Движок вывода Atlas стал открытым: чистый Rust + CUDA, более 100 токенов/с на DGX Spark

Движок Atlas, ранее показывавший 102 ток/с на Qwen3.5-35B на DGX Spark, теперь опубликован с открытым исходным кодом на GitHub. Написанный на чистом Rust и CUDA без PyTorch или Python runtime, Atlas поставляется в виде Docker-образа размером ~2,5 ГБ и имеет холодный старт менее 2 минут. Команда переписала весь стек от HTTP-обработчика до диспетчеризации ядер, чтобы устранить накладные расходы Python размером 20+ ГБ, которые были узким местом для GPU.
Ключевые показатели на DGX Spark (GB10)
- Qwen3.5-35B (NVFP4, MTP K=2): пик 130 ток/с, устойчиво ~111 ток/с — в 3,0–3,3 раза быстрее vLLM на момент тестирования
- Qwen3.5-122B (NVFP4, EP=2): ~50 ток/с декодирования
- Qwen3-Next-80B-A3B (NVFP4, MTP): ~87 ток/с
- Nemotron-3 Nano 30B (FP8): ~88 ток/с
- Полная матрица моделей, включая MiniMax2.7, Qwen3.6, Gemma, доступна на сайте
Что делает Atlas особенным
- Вручную настроенные ядра CUDA для Blackwell SM120/121: attention, MoE, GDN, Mamba-2 — без универсальных запасных вариантов
- Нативная поддержка NVFP4 + FP8 на тензорных ядрах
- Спекулятивное декодирование MTP (Multi-Token Prediction) для повышения пропускной способности декодирования до 3 раз
- Совместимость с API OpenAI и Anthropic на одном порту — работает с Claude Code, Cline, OpenCode, Open WebUI из коробки
Быстрый старт
docker pull avarok/atlas-gb10:latest
sudo docker run -d --name atlas --network host --gpus all --ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
avarok/atlas-gb10:latest serve Qwen/Qwen3.6-35B-A3B-FP8 \
--port 8888 --speculative --enable-prefix-caching
План развития и сообщество
Команда работает над портом для Strix Halo совместно с Spectral Compute (оборудование предоставлено AMD), а также запланирован порт для RTX 6000 Pro Blackwell. План развития формируется сообществом — поддержка MiniMax M2.7 была добавлена по запросу из Discord. Atlas нацелен на качественную поддержку четырех чипов, а не на плохую поддержку двадцати.
Для пользователей без Spark текущая сборка работает только на DGX Spark, но код открыт для адаптации.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Бесплатный MCP позволяет Клоду автоматически анализировать данные Google Search Console
Бесплатный MCP-сервер (Model Context Protocol) позволяет Клоду напрямую запрашивать данные Google Search Console для любого сайта, к которому у вас есть доступ. Спрашивайте о запросах, страницах, кликах, показах, CTR и позициях без ручного экспорта CSV.

TestThread: Фреймворк с открытым исходным кодом для тестирования ИИ-агентов
TestThread — это фреймворк с открытым исходным кодом для тестирования ИИ-агентов, который запускает тесты на реальных конечных точках, предоставляет результаты прохождения/непрохождения с ИИ-диагностикой и включает такие функции, как семантическое сопоставление, обнаружение PII и интеграцию с CI/CD.

repo-mem: Сервер MCP с открытым исходным кодом добавляет постоянную коллективную память в Claude Code
repo-mem — это сервер MCP с открытым исходным кодом, который добавляет постоянную, общую память в сессии Claude Code, используя SQLite и Git. Он решает проблему изоляции команд, сохраняя наблюдения в базах данных для каждого пользователя, которые затем фиксируются в репозитории.

OpenClaw Smart Router с открытым исходным кодом для автоматического выбора моделей
Разработчик опубликовал в открытом доступе Smart Router для OpenClaw, который автоматически классифицирует запросы по сложности и направляет их к оптимальным моделям, экономя 60-80% затрат на API по сравнению с постоянным использованием премиальных моделей, таких как Claude или GPT-4o.