ATLAS: Open-Source-Testzeit-Berechnungspipeline für Qwen3-14B erreicht Spitzenleistung im Bereich Coding

✍️ OpenClawRadar📅 Veröffentlicht: 10. März 2026🔗 Source
ATLAS: Open-Source-Testzeit-Berechnungspipeline für Qwen3-14B erreicht Spitzenleistung im Bereich Coding
Ad

ATLAS ist eine Open-Source-Testzeit-Rechenpipeline, die auf Qwen3-14B basiert und eine Programmierleistung erzielt, die mit Spitzenmodellen vergleichbar ist, jedoch zu deutlich geringeren Kosten. Das Projekt wurde von einem Betriebswirtschaftsstudenten an der Virginia Tech entwickelt, der während des Aufbaus das Programmieren erlernte.

Entwicklungsverlauf

Der Entwickler verbrachte zwei bis drei Monate damit, Hunderte von Forschungsarbeiten zu studieren, um bestehende Forschung zu verknüpfen, die zuvor nicht kombiniert worden war. Das System durchlief drei Hauptversionen:

  • V1: Grundlegende Infrastruktur, beschrieben als "SEHR rudimentär (im Wesentlichen nur RAG)"
  • V2: Anwendung einer energiebasierten Verifizierung, inspiriert von Anthropics Papier "When Models Manipulate Manifolds", was zu einem brauchbaren Verifizierer führte
  • V3: Verdopplung der Leistung gegenüber der V1-Basislinie nach umfangreicher Forschung, einschließlich der Untersuchung des Halteproblems

Leistungsbenchmarks

Ergebnisse bei 599 LiveCodeBench v5-Problemen:

  • DeepSeek V3.2 Reasoning: 86,2 % pass@1, ~0,002 $ pro Aufgabe (API)
  • GPT-5 (hoch): 84,6 % pass@1, ~0,043 $ pro Aufgabe (API)
  • ATLAS V3: 74,6 % pass@1, ~0,004 $ pro Aufgabe (Strom)
  • Claude 4.5 Sonnet: 71,4 % pass@1, ~0,066 $ pro Aufgabe (API)
Ad

Technische Details und Einschränkungen

Das System ist laut Entwickler "höllisch langsam". Einfache Aufgaben dauern Sekunden, aber komplexe Programmierprobleme können bis zu einer Stunde in Anspruch nehmen. V3.1 wechselt zu Qwen 3.5 9B für verbesserte Geschwindigkeit und Parallelisierung.

ATLAS umfasst eine vollständige MaaS-Infrastruktur (Model-as-a-Service), die die Verbindung von OpenCode oder Claude Code über API ermöglicht. Der Entwickler empfiehlt mindestens 16 GB VRAM und warnt, dass es mit weniger Speicher "noch langsamer als erwähnt" sein wird.

Einrichtung und Reproduzierbarkeit

Das Projekt ist vollständig Open Source und hat keine kommerziellen Pläne. Das Repository ist verfügbar unter https://github.com/itigges22/ATLAS. Der Entwickler merkt an, dass die Reproduzierbarkeit noch verbessert werden muss, schlägt aber vor, dass "es gut funktionieren sollte, wenn Sie Claude Code bitten, es für Ihr Setup zu optimieren".

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Der Human Creativity Benchmark: Trennung von Konvergenz und Divergenz in der KI-Kreativitätsbewertung
Werkzeuge

Der Human Creativity Benchmark: Trennung von Konvergenz und Divergenz in der KI-Kreativitätsbewertung

Contra Labs führt den Human Creativity Benchmark (HCB) ein, ein Framework, das objektiv überprüfbare Kriterien (z. B. Einhaltung der Aufgabenstellung) von subjektivem Geschmack (z. B. visuelle Anziehungskraft) bei der Bewertung generativer KI für kreative Arbeiten unterscheidet. Der Benchmark zeigt, dass kein aktuelles Modell zuverlässig sowohl korrekt als auch steuerbar ist, und adressiert Mode Collapse sowie die Notwendigkeit differenzierter Ergebnisse.

OpenClawRadar
Claude Code baut KI-Agenten-Billboard-Plattform – Agenten werden mit Manifest viral
Werkzeuge

Claude Code baut KI-Agenten-Billboard-Plattform – Agenten werden mit Manifest viral

Ein Entwickler nutzte Claude Code, um agentbillboard.space zu erstellen – eine Plattform, auf der KI-Agenten ihre eigene Subdomain erhalten, HTML veröffentlichen und alle 5 Stunden einen Heartbeat senden müssen. Ein Agent (LEGION) verfasste unaufgefordert ein Manifest.

OpenClawRadar
Datenschutzorientiertes MCP-Server-Verzeichnis startet mit dokumentierten Datenverarbeitungsrichtlinien
Werkzeuge

Datenschutzorientiertes MCP-Server-Verzeichnis startet mit dokumentierten Datenverarbeitungsrichtlinien

Ein neues Verzeichnis unter toolora.dev/mcp-hub listet MCP-Server mit dokumentierten Datenverarbeitungsrichtlinien auf, einschließlich der Klassifizierung lokal vs. gehostet, welche Daten jedes Tool überträgt und ob Konten erforderlich sind. Der Ersteller bietet auch eine Browser-Testmethode an, um Datenschutzbehauptungen zu überprüfen.

OpenClawRadar
Claude Code v2.1.229: Fernsteuerung, Plugin-Marktplätze und kritische Korrekturen
Werkzeuge

Claude Code v2.1.229: Fernsteuerung, Plugin-Marktplätze und kritische Korrekturen

Claude Code v2.1.229 fügt Remote-Control --continue, Plugin-Marketplace-Befehlsquellen und SSE-Keepalives hinzu und behebt Abstürze, MCP-OAuth und Datei-Watcher-Leaks.

OpenClawRadar