Движок вывода Atlas стал открытым: чистый Rust + CUDA, более 100 токенов/с на DGX Spark

Движок Atlas, ранее показывавший 102 ток/с на Qwen3.5-35B на DGX Spark, теперь опубликован с открытым исходным кодом на GitHub. Написанный на чистом Rust и CUDA без PyTorch или Python runtime, Atlas поставляется в виде Docker-образа размером ~2,5 ГБ и имеет холодный старт менее 2 минут. Команда переписала весь стек от HTTP-обработчика до диспетчеризации ядер, чтобы устранить накладные расходы Python размером 20+ ГБ, которые были узким местом для GPU.
Ключевые показатели на DGX Spark (GB10)
- Qwen3.5-35B (NVFP4, MTP K=2): пик 130 ток/с, устойчиво ~111 ток/с — в 3,0–3,3 раза быстрее vLLM на момент тестирования
- Qwen3.5-122B (NVFP4, EP=2): ~50 ток/с декодирования
- Qwen3-Next-80B-A3B (NVFP4, MTP): ~87 ток/с
- Nemotron-3 Nano 30B (FP8): ~88 ток/с
- Полная матрица моделей, включая MiniMax2.7, Qwen3.6, Gemma, доступна на сайте
Что делает Atlas особенным
- Вручную настроенные ядра CUDA для Blackwell SM120/121: attention, MoE, GDN, Mamba-2 — без универсальных запасных вариантов
- Нативная поддержка NVFP4 + FP8 на тензорных ядрах
- Спекулятивное декодирование MTP (Multi-Token Prediction) для повышения пропускной способности декодирования до 3 раз
- Совместимость с API OpenAI и Anthropic на одном порту — работает с Claude Code, Cline, OpenCode, Open WebUI из коробки
Быстрый старт
docker pull avarok/atlas-gb10:latest
sudo docker run -d --name atlas --network host --gpus all --ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
avarok/atlas-gb10:latest serve Qwen/Qwen3.6-35B-A3B-FP8 \
--port 8888 --speculative --enable-prefix-caching
План развития и сообщество
Команда работает над портом для Strix Halo совместно с Spectral Compute (оборудование предоставлено AMD), а также запланирован порт для RTX 6000 Pro Blackwell. План развития формируется сообществом — поддержка MiniMax M2.7 была добавлена по запросу из Discord. Atlas нацелен на качественную поддержку четырех чипов, а не на плохую поддержку двадцати.
Для пользователей без Spark текущая сборка работает только на DGX Spark, но код открыт для адаптации.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Открытая система поиска работы на основе ИИ, созданная с помощью Claude Code, оценивает предложения и генерирует адаптированные резюме
Разработчик открыл исходный код проекта Claude Code, который превращает ваш терминал в командный центр поиска работы. Система оценивает предложения о работе по 10 параметрам, генерирует PDF-резюме, оптимизированные для систем отслеживания кандидатов, сканирует более 45 страниц карьеры компаний и включает 14 режимов навыков.

AIBrain добавляет постоянную память и возможность самоулучшения к Claude Code.
AIBrain — это инструмент, который предоставляет Claude Code постоянную память между сессиями с семантическим поиском и циклами самоулучшения. Он включает 53 рабочих процесса, 44 навыка, 9 MCP-серверов и поддерживает многоагентную сетевую сеть через Tailscale.

Фазовое удержание: Система управления ИИ-агентами, вдохновлённая методами воспитания детей
Phaselock — это открытый исходный код навыка агента, который реализует четыре механизма контроля для ИИ-агентов, занимающихся программированием: явные шлюзы перед действием, немедленная обратная связь об ошибках, ограниченный выбор и механическое применение правил. Работает с Claude Code, Cursor, Windsurf и любыми инструментами, поддерживающими хуки.

Система ACO: мультиагентный ИИ-конвейер от задачи на GitHub до объединённого PR
ACO System — это мультиагентный фреймворк с открытым исходным кодом, где шесть специализированных AI-агентов автономно выполняют весь процесс разработки от GitHub Issue до объединенного PR, а детерминированный шлюз Architect отсеивает плохие задачи до того, как они попадут к разработчикам.