ATLAS : Pipeline de calcul en temps de test open-source pour Qwen3-14B atteint des performances de codage de niveau frontière

ATLAS est un pipeline de calcul en temps de test open-source construit autour de Qwen3-14B qui atteint des performances en programmation comparables aux modèles de pointe à un coût significativement inférieur. Le projet a été développé par un étudiant en gestion d'entreprise à Virginia Tech qui a appris à coder en le construisant.
Évolution du développement
Le développeur a passé deux à trois mois à étudier des centaines d'articles de recherche pour relier des travaux existants qui n'avaient jamais été combinés auparavant. Le système a évolué à travers trois versions majeures :
- V1 : Infrastructure de base, décrite comme "TRÈS rudimentaire (essentiellement juste du RAG)"
- V2 : Application d'une vérification basée sur l'énergie inspirée par l'article d'Anthropic "When Models Manipulate Manifolds", résultant en un vérificateur décent
- V3 : Performances doublées par rapport à la base V1 après des recherches approfondies incluant l'exploration du problème de l'arrêt
Benchmarks de performance
Résultats sur 599 problèmes LiveCodeBench v5 :
- DeepSeek V3.2 Reasoning : 86,2 % pass@1, ~0,002 $ par tâche (API)
- GPT-5 (élevé) : 84,6 % pass@1, ~0,043 $ par tâche (API)
- ATLAS V3 : 74,6 % pass@1, ~0,004 $ par tâche (électricité)
- Claude 4.5 Sonnet : 71,4 % pass@1, ~0,066 $ par tâche (API)
Détails techniques et limitations
Le système est "lent comme l'enfer" selon le développeur. Les tâches faciles prennent quelques secondes, mais les problèmes de programmation complexes peuvent prendre jusqu'à une heure. La version V3.1 passe à Qwen 3.5 9B pour une vitesse et une parallélisation améliorées.
ATLAS inclut une infrastructure complète MaaS (Model-as-a-Service) qui permet de connecter OpenCode ou Claude Code via API. Le développeur recommande au moins 16 Go de VRAM, avertissant qu'avec moins de mémoire, ce sera "encore plus lent que ce que j'ai mentionné".
Configuration et reproductibilité
Le projet est entièrement open source sans plans de commercialisation. Le dépôt est disponible à https://github.com/itigges22/ATLAS. Le développeur note que la reproductibilité nécessite des améliorations, mais suggère que "si vous demandez à Claude Code de l'optimiser pour votre configuration, cela devrait bien fonctionner".
📖 Read the full source: r/LocalLLaMA
👀 See Also

Tilde.run : Un bac à sable agent avec un système de fichiers transactionnel et versionné
Tilde.run fournit des sandbox isolés et réversibles pour les agents IA, avec un système de fichiers versionné qui monte GitHub, S3 et Google Drive, et une isolation réseau par défaut.

OpenClaw Nerve WebUI ajoute le contrôle vocal et un tableau de bord de gestion d'équipe.
Nerve est une interface WebUI pour OpenClaw qui offre un tableau de bord tout-en-un pour surveiller et gérer des agents IA, avec contrôle vocal via double-tap shift pour Whisper et des capacités de création d'équipes de sous-agents.

Les défaillances de boucle multi-agents sont des défaillances de conception organisationnelle, pas des défaillances d'instruction.
Les boucles d'agents entre pairs ne sont pas des bugs de prompt, mais des problèmes d'organigramme. Traitez les réseaux d'agents comme des hiérarchies avec une autorité d'arrêt claire.

InsForge : Backend Postgres auto-hébergé avec intégration MCP pour agents de codage IA
InsForge est une alternative open source et auto-hébergée à Supabase qui se connecte à Claude Code via MCP, permettant aux agents IA de voir le schéma, les politiques et l'état du service. Il inclut PostgreSQL 16.4, PostgREST, Deno Runtime, l'authentification, le stockage et les fonctions edge.