Движок вывода Atlas стал открытым: чистый Rust + CUDA, более 100 токенов/с на DGX Spark

✍️ OpenClawRadar📅 Опубликовано: 6 мая 2026 г.🔗 Source
Движок вывода Atlas стал открытым: чистый Rust + CUDA, более 100 токенов/с на DGX Spark
Ad

Движок Atlas, ранее показывавший 102 ток/с на Qwen3.5-35B на DGX Spark, теперь опубликован с открытым исходным кодом на GitHub. Написанный на чистом Rust и CUDA без PyTorch или Python runtime, Atlas поставляется в виде Docker-образа размером ~2,5 ГБ и имеет холодный старт менее 2 минут. Команда переписала весь стек от HTTP-обработчика до диспетчеризации ядер, чтобы устранить накладные расходы Python размером 20+ ГБ, которые были узким местом для GPU.

Ключевые показатели на DGX Spark (GB10)

  • Qwen3.5-35B (NVFP4, MTP K=2): пик 130 ток/с, устойчиво ~111 ток/с — в 3,0–3,3 раза быстрее vLLM на момент тестирования
  • Qwen3.5-122B (NVFP4, EP=2): ~50 ток/с декодирования
  • Qwen3-Next-80B-A3B (NVFP4, MTP): ~87 ток/с
  • Nemotron-3 Nano 30B (FP8): ~88 ток/с
  • Полная матрица моделей, включая MiniMax2.7, Qwen3.6, Gemma, доступна на сайте

Что делает Atlas особенным

  • Вручную настроенные ядра CUDA для Blackwell SM120/121: attention, MoE, GDN, Mamba-2 — без универсальных запасных вариантов
  • Нативная поддержка NVFP4 + FP8 на тензорных ядрах
  • Спекулятивное декодирование MTP (Multi-Token Prediction) для повышения пропускной способности декодирования до 3 раз
  • Совместимость с API OpenAI и Anthropic на одном порту — работает с Claude Code, Cline, OpenCode, Open WebUI из коробки
Ad

Быстрый старт

docker pull avarok/atlas-gb10:latest
sudo docker run -d --name atlas --network host --gpus all --ipc=host \
    -v ~/.cache/huggingface:/root/.cache/huggingface \
    avarok/atlas-gb10:latest serve Qwen/Qwen3.6-35B-A3B-FP8 \
    --port 8888 --speculative --enable-prefix-caching

План развития и сообщество

Команда работает над портом для Strix Halo совместно с Spectral Compute (оборудование предоставлено AMD), а также запланирован порт для RTX 6000 Pro Blackwell. План развития формируется сообществом — поддержка MiniMax M2.7 была добавлена по запросу из Discord. Atlas нацелен на качественную поддержку четырех чипов, а не на плохую поддержку двадцати.

Для пользователей без Spark текущая сборка работает только на DGX Spark, но код открыт для адаптации.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Бесплатный MCP позволяет Клоду автоматически анализировать данные Google Search Console
Инструменты

Бесплатный MCP позволяет Клоду автоматически анализировать данные Google Search Console

Бесплатный MCP-сервер (Model Context Protocol) позволяет Клоду напрямую запрашивать данные Google Search Console для любого сайта, к которому у вас есть доступ. Спрашивайте о запросах, страницах, кликах, показах, CTR и позициях без ручного экспорта CSV.

OpenClawRadar
TestThread: Фреймворк с открытым исходным кодом для тестирования ИИ-агентов
Инструменты

TestThread: Фреймворк с открытым исходным кодом для тестирования ИИ-агентов

TestThread — это фреймворк с открытым исходным кодом для тестирования ИИ-агентов, который запускает тесты на реальных конечных точках, предоставляет результаты прохождения/непрохождения с ИИ-диагностикой и включает такие функции, как семантическое сопоставление, обнаружение PII и интеграцию с CI/CD.

OpenClawRadar
repo-mem: Сервер MCP с открытым исходным кодом добавляет постоянную коллективную память в Claude Code
Инструменты

repo-mem: Сервер MCP с открытым исходным кодом добавляет постоянную коллективную память в Claude Code

repo-mem — это сервер MCP с открытым исходным кодом, который добавляет постоянную, общую память в сессии Claude Code, используя SQLite и Git. Он решает проблему изоляции команд, сохраняя наблюдения в базах данных для каждого пользователя, которые затем фиксируются в репозитории.

OpenClawRadar
OpenClaw Smart Router с открытым исходным кодом для автоматического выбора моделей
Инструменты

OpenClaw Smart Router с открытым исходным кодом для автоматического выбора моделей

Разработчик опубликовал в открытом доступе Smart Router для OpenClaw, который автоматически классифицирует запросы по сложности и направляет их к оптимальным моделям, экономя 60-80% затрат на API по сравнению с постоянным использованием премиальных моделей, таких как Claude или GPT-4o.

OpenClawRadar