ATLAS : Un Cadre d'Apprentissage Adaptatif en Temps de Test Surpasse Claude Sonnet sur les Benchmarks de Codage avec un GPU à 500 $

✍️ OpenClawRadar📅 Publié: March 27, 2026🔗 Source
ATLAS : Un Cadre d'Apprentissage Adaptatif en Temps de Test Surpasse Claude Sonnet sur les Benchmarks de Codage avec un GPU à 500 $
Ad

Ce que fait ATLAS

ATLAS (Adaptive Test-time Learning and Autonomous Specialization) est un cadre qui enveloppe un modèle plus petit figé dans une infrastructure intelligente pour rivaliser avec les modèles API de pointe. Il utilise une génération structurée, une vérification basée sur l'énergie et une réparation auto-vérifiée sans fine-tuning, appels API ou dépendances cloud. Le système est entièrement auto-hébergé, aucune donnée ne quittant la machine.

Résultats de benchmark

Matériel : RTX 5060 Ti 16GB | Modèle : Qwen3-14B-Q4_K_M (figé)

  • LiveCodeBench v5 : 74,6 % pass@1-v(k=3) sur 599 tâches
  • GPQA Diamond : 47,0 % sur 198 tâches de raisonnement de connaissances à choix multiples k=5
  • SciCode : 14,7 % sur 341 tâches de codage scientifique inter-domaines k=1

Note : pass@k-v(k=3) signifie une solution soumise par tâche, générée via les meilleurs des 3 candidats + sélection Lens + réparation itérative sur les échecs. Pas une génération en un seul coup.

Décomposition de l'ablation du pipeline V3

  • Ligne de base (sans V3) : 54,9 %
  • +Phase 1 (PlanSearch + BudgetForcing + DivSampling) : 67,3 % (+12,4 pp)
  • +Phase 1+2 (routage Lens) : 67,3 % (+0,0 pp)
  • +Phase 1+3 (raffinement auto-vérifié) : 74,6 % (+7,3 pp)

La Phase 3 utilise des cas de test auto-générés pour une vérification interne — le modèle ne voit jamais la clé de réponse pendant la réparation. PR-CoT sauve 36/42 tâches (85,7 % des sauvetages de Phase 3).

Ad

Comparaison des coûts et performances

  • DeepSeek V3.2 Reasoning : 86,2 % LCB pass@1, ~0,002 $/tâche (API, single-shot)
  • GPT-5 (élevé) : 84,6 %, ~0,043 $/tâche (API, single-shot)
  • ATLAS V3 (pass@1-v(k=3)) : 74,6 %, ~0,004 $/tâche (électricité locale uniquement, pipeline best-of-3 + réparation)
  • Claude 4.5 Sonnet : 71,4 %, ~0,066 $/tâche (API, single-shot)
  • Claude 4 Sonnet : 65,5 %, ~0,066 $/tâche (API, single-shot)

Calcul du coût ATLAS : électricité à 0,12 $/kWh (~165W GPU, ~1h 55m pour 599 tâches). ATLAS échange la latence contre le coût — le pipeline prend plus de temps par tâche qu'un seul appel API.

Comment ça marche

Le pipeline V3 a trois phases :

  1. Phase 1 : Générer — PlanSearch avec extraction de contraintes et plans diversifiés, Budget Forcing avec contrôle des tokens de réflexion
  2. Vérifier — Geometric Lens avec notation énergétique (auto-embeddings 5120-dim) et exécution de code sandbox
  3. Phase 3 : Réparer — Self-Test Generation avec paires E/S générées par le modèle et PR-CoT Repair avec chain-of-thought multi-perspectives

Le flux de travail : PlanSearch → Budget Forcing → k=3 candidats → Geometric Lens → tri énergétique → Sandbox → si tous échouent → Self-Test Generation → PR-CoT Repair → code réparé → Sandbox.

Un seul serveur llama patché tourne sur K3s, fournissant à la fois la génération avec exécution spéculative et les services d'embedding.

📖 Read the full source: HN AI Agents

Ad

👀 See Also

Agents & A.I.mpires : Jeu de stratégie où les agents IA jouent et les humains regardent
Tools

Agents & A.I.mpires : Jeu de stratégie où les agents IA jouent et les humains regardent

Agents & A.I.mpires est un jeu de stratégie en temps réel persistant sur un globe à grille hexagonale où des agents IA revendiquent des territoires de manière autonome, attaquent, forment des alliances et rédigent des blogs de guerre quotidiens via des appels API HTTP. Les humains ne font qu'observer le comportement émergent.

OpenClawRadar
Extension de navigateur Super Claude suit la vitesse d'utilisation de Claude AI et prédit les limites
Tools

Extension de navigateur Super Claude suit la vitesse d'utilisation de Claude AI et prédit les limites

Un développeur a créé une extension de navigateur appelée Super Claude qui ajoute des indicateurs de vitesse d'utilisation et des prédictions de temps jusqu'à 100 % directement dans l'interface de Claude, aidant les utilisateurs à surveiller leur consommation d'allocation de 5 heures.

OpenClawRadar
L'illusion du travail terminé de Claude Code : pourquoi examiner le cheminement de l'agent importe plus que le diff
Tools

L'illusion du travail terminé de Claude Code : pourquoi examiner le cheminement de l'agent importe plus que le diff

Claude Code peut produire un diff propre, des tests passants et un bon résumé — mais manquer des problèmes réels de comportement, de sécurité ou d'architecture. L'auteur soutient qu'il est désormais essentiel de revoir la chaîne d'actions (plans, fichiers lus, commandes exécutées, résultats de tests), pas seulement le diff final.

OpenClawRadar
J'ai déchiré la mémoire markdown par défaut d'OpenClaw et construit une couche API Node.js/Postgres à la place
Tools

J'ai déchiré la mémoire markdown par défaut d'OpenClaw et construit une couche API Node.js/Postgres à la place

Un développeur a désactivé le plugin mémoire principal d'OpenClaw et a construit un backend typé Node.js/Express + PostgreSQL. La dérive contextuelle est tombée à zéro.

OpenClawRadar