O mecanismo de inferência Atlas se torna open source: Rust puro + CUDA, mais de 100 tok/s no DGX Spark

✍️ OpenClawRadar📅 Publicado: May 6, 2026🔗 Source
O mecanismo de inferência Atlas se torna open source: Rust puro + CUDA, mais de 100 tok/s no DGX Spark
Ad

O motor de inferência Atlas, anteriormente anunciado atingindo 102 tok/s no Qwen3.5-35B em um DGX Spark, agora é open source no GitHub. Escrito em Rust puro e CUDA, sem PyTorch ou runtime Python, o Atlas oferece uma imagem Docker de ~2,5 GB e cold start inferior a 2 minutos. A equipe reescreveu toda a pilha, do handler HTTP ao dispatch do kernel, para eliminar a sobrecarga de 20+ GB do Python que estava engargalando a GPU.

Benchmarks Principais no DGX Spark (GB10)

  • Qwen3.5-35B (NVFP4, MTP K=2): 130 tok/s de pico, ~111 tok/s sustentados — 3,0–3,3× vLLM no momento do teste
  • Qwen3.5-122B (NVFP4, EP=2): ~50 tok/s de decode
  • Qwen3-Next-80B-A3B (NVFP4, MTP): ~87 tok/s
  • Nemotron-3 Nano 30B (FP8): ~88 tok/s
  • Matriz completa de modelos, incluindo MiniMax2.7, Qwen3.6, Gemma, disponível no site

O Que Torna o Atlas Diferente

  • Kernels CUDA ajustados manualmente para Blackwell SM120/121: atenção, MoE, GDN, Mamba-2 — sem fallbacks genéricos
  • NVFP4 nativo + FP8 em tensor cores
  • Decodificação especulativa MTP (Multi-Token Prediction) para até 3× de throughput em decode
  • Compatibilidade com APIs OpenAI + Anthropic na mesma porta — funciona com Claude Code, Cline, OpenCode, Open WebUI prontamente
Ad

Início Rápido

docker pull avarok/atlas-gb10:latest
sudo docker run -d --name atlas --network host --gpus all --ipc=host \
    -v ~/.cache/huggingface:/root/.cache/huggingface \
    avarok/atlas-gb10:latest serve Qwen/Qwen3.6-35B-A3B-FP8 \
    --port 8888 --speculative --enable-prefix-caching

Roadmap & Comunidade

A equipe está trabalhando em uma porta Strix Halo com a Spectral Compute (hardware fornecido pela AMD), e uma porta RTX 6000 Pro Blackwell está planejada. O roadmap é guiado pela comunidade — o suporte MiniMax M2.7 veio de uma solicitação no Discord. O Atlas tem como alvo quatro chips bem, em vez de vinte mal.

Para usuários que não usam Spark, o binário atual é exclusivo para DGX Spark, mas o código está aberto para adaptação.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

O formato WCY reduz a sobrecarga de tokens de LLM em 50-71% e adiciona marcadores estruturais de "não sei".
Tools

O formato WCY reduz a sobrecarga de tokens de LLM em 50-71% e adiciona marcadores estruturais de "não sei".

WCY (Watch-Compute-Yield) é um formato orientado a linhas que reduz a sobrecarga de tokens JSON em 50-71% e introduz marcadores estruturais '?' para que LLMs indiquem incerteza durante o raciocínio. O formato não requer ajuste fino—apenas três exemplos de poucas amostras.

OpenClawRadar
Ferramenta de sincronização de documentos/contexto de IA para desenvolvedores ganha tração após post no Reddit
Tools

Ferramenta de sincronização de documentos/contexto de IA para desenvolvedores ganha tração após post no Reddit

Um desenvolvedor compartilhou sua ferramenta de sincronização de documentação e contexto de IA no Reddit, resultando em 1,1 mil downloads, 60 estrelas no GitHub e 192 clones únicos em duas semanas após a postagem em 22 de março.

OpenClawRadar
Gemma 4 26B vs Qwen 3.5 27B: Benchmark de Fluxo de Trabalho Empresarial Local em RTX 4090
Tools

Gemma 4 26B vs Qwen 3.5 27B: Benchmark de Fluxo de Trabalho Empresarial Local em RTX 4090

Um desenvolvedor testou o Gemma 4 26B e o Qwen 3.5 27B em uma estação de trabalho RTX 4090 para 18 tarefas reais de operador de negócios. O Gemma venceu por 13 a 5, mostrando velocidade mais rápida e melhor disciplina para trabalho de execução diária, enquanto o Qwen se destacou em pensamento estratégico mais amplo.

OpenClawRadar
MuninnDB adiciona Dream Engine para consolidação de memória de LLM com isolamento de cofre
Tools

MuninnDB adiciona Dream Engine para consolidação de memória de LLM com isolamento de cofre

MuninnDB, um banco de dados de memória cognitiva baseado em Go, agora inclui um Motor de Sonhos que realiza consolidação de memória dirigida por LLM entre sessões usando limiares de deduplicação e revisão semântica. O sistema apresenta níveis de confiança de cofre para isolamento de dados e roda localmente com Ollama.

OpenClawRadar