El motor de inferencia Atlas se vuelve de código abierto: Rust puro + CUDA, más de 100 tok/s en DGX Spark

✍️ OpenClawRadar📅 Publicado: 6 de mayo de 2026🔗 Source
El motor de inferencia Atlas se vuelve de código abierto: Rust puro + CUDA, más de 100 tok/s en DGX Spark
Ad

El motor de inferencia Atlas, que anteriormente había sido anticipado alcanzando 102 tok/s en Qwen3.5-35B en un DGX Spark, ahora es de código abierto en GitHub. Escrito en Rust puro y CUDA sin PyTorch ni tiempo de ejecución de Python, Atlas ofrece una imagen Docker de ~2.5 GB y un arranque en frío de menos de 2 minutos. El equipo reescribió toda la pila, desde el manejador HTTP hasta el despacho de kernels, para eliminar la sobrecarga de más de 20 GB de Python que estaba limitando la GPU.

Puntos de referencia clave en DGX Spark (GB10)

  • Qwen3.5-35B (NVFP4, MTP K=2): pico de 130 tok/s, ~111 tok/s sostenidos — 3.0–3.3× vLLM en el momento de la prueba
  • Qwen3.5-122B (NVFP4, EP=2): ~50 tok/s de decodificación
  • Qwen3-Next-80B-A3B (NVFP4, MTP): ~87 tok/s
  • Nemotron-3 Nano 30B (FP8): ~88 tok/s
  • Matriz completa de modelos que incluye MiniMax2.7, Qwen3.6, Gemma disponible en el sitio

Qué hace diferente a Atlas

  • Kernels CUDA ajustados a mano para Blackwell SM120/121: atención, MoE, GDN, Mamba-2 — sin alternativas genéricas
  • NVFP4 + FP8 nativos en núcleos tensoriales
  • Decodificación especulativa MTP (predicción de múltiples tokens) para hasta 3× de rendimiento en decodificación
  • Compatibilidad con API de OpenAI + Anthropic en el mismo puerto: funciona con Claude Code, Cline, OpenCode, Open WebUI listo para usar
Ad

Inicio rápido

docker pull avarok/atlas-gb10:latest
sudo docker run -d --name atlas --network host --gpus all --ipc=host \
    -v ~/.cache/huggingface:/root/.cache/huggingface \
    avarok/atlas-gb10:latest serve Qwen/Qwen3.6-35B-A3B-FP8 \
    --port 8888 --speculative --enable-prefix-caching

Hoja de ruta y comunidad

El equipo está trabajando en un puerto para Strix Halo con Spectral Compute (hardware proporcionado por AMD), y se planea un puerto para RTX 6000 Pro Blackwell. La hoja de ruta está impulsada por la comunidad — el soporte para MiniMax M2.7 llegó por una solicitud en Discord. Atlas apunta a cuatro chips bien en lugar de veinte mal.

Para usuarios que no usan Spark, el binario actual es solo para DGX Spark, pero el código está abierto para adaptación.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Storybloq: Un Seguidor de Proyectos que Vive en el Directorio .story/ de tu Repositorio Ahora Tiene una App para Mac
Herramientas

Storybloq: Un Seguidor de Proyectos que Vive en el Directorio .story/ de tu Repositorio Ahora Tiene una App para Mac

Storybloq, un rastreador de proyectos que almacena tickets, incidencias, fases de hoja de ruta y traspasos de sesión como JSON/markdown dentro de .story/ en tu repositorio, ahora tiene una aplicación gratuita para Mac en la App Store. Se integra con Claude Code a través de CLI y servidor MCP, y fue construido completamente usando Claude Code.

OpenClawRadar
Crítica: CLI de binario único y prioridad local para revisar planes y diferencias de agente
Herramientas

Crítica: CLI de binario único y prioridad local para revisar planes y diferencias de agente

Crit es una CLI de un solo binario que abre archivos o diffs en un navegador con una interfaz inspirada en GitHub, permitiendo ciclos de retroalimentación multi-ronda con agentes de codificación de IA, sin necesidad de cuenta.

OpenClawRadar
Construyendo un Agente de Investigación Autónomo con C# y LLMs Locales
Herramientas

Construyendo un Agente de Investigación Autónomo con C# y LLMs Locales

Un agente de investigación en C# automatiza el procesamiento de URL con LLM locales utilizando Ollama y llama3.1:8b, generando informes estructurados en markdown a partir de búsquedas web.

OpenClawRadar
Shieldbot: Plugin de Escáner de Seguridad de Código Abierto para Claude Code
Herramientas

Shieldbot: Plugin de Escáner de Seguridad de Código Abierto para Claude Code

Shieldbot es un escáner de seguridad de código abierto que se ejecuta como un complemento dentro de Claude Code, integrando seis escáneres que incluyen Semgrep con más de 5.000 reglas, Bandit, Ruff, detect-secrets, pip-audit y npm audit. Elimina hallazgos duplicados y genera informes priorizados con puntuaciones de riesgo y correcciones de código.

OpenClawRadar