ATLAS: Open-Source-Testzeit-Berechnungspipeline für Qwen3-14B erreicht Spitzenleistung im Bereich Coding

✍️ OpenClawRadar📅 Veröffentlicht: 10. März 2026🔗 Source
ATLAS: Open-Source-Testzeit-Berechnungspipeline für Qwen3-14B erreicht Spitzenleistung im Bereich Coding
Ad

ATLAS ist eine Open-Source-Testzeit-Rechenpipeline, die auf Qwen3-14B basiert und eine Programmierleistung erzielt, die mit Spitzenmodellen vergleichbar ist, jedoch zu deutlich geringeren Kosten. Das Projekt wurde von einem Betriebswirtschaftsstudenten an der Virginia Tech entwickelt, der während des Aufbaus das Programmieren erlernte.

Entwicklungsverlauf

Der Entwickler verbrachte zwei bis drei Monate damit, Hunderte von Forschungsarbeiten zu studieren, um bestehende Forschung zu verknüpfen, die zuvor nicht kombiniert worden war. Das System durchlief drei Hauptversionen:

  • V1: Grundlegende Infrastruktur, beschrieben als "SEHR rudimentär (im Wesentlichen nur RAG)"
  • V2: Anwendung einer energiebasierten Verifizierung, inspiriert von Anthropics Papier "When Models Manipulate Manifolds", was zu einem brauchbaren Verifizierer führte
  • V3: Verdopplung der Leistung gegenüber der V1-Basislinie nach umfangreicher Forschung, einschließlich der Untersuchung des Halteproblems

Leistungsbenchmarks

Ergebnisse bei 599 LiveCodeBench v5-Problemen:

  • DeepSeek V3.2 Reasoning: 86,2 % pass@1, ~0,002 $ pro Aufgabe (API)
  • GPT-5 (hoch): 84,6 % pass@1, ~0,043 $ pro Aufgabe (API)
  • ATLAS V3: 74,6 % pass@1, ~0,004 $ pro Aufgabe (Strom)
  • Claude 4.5 Sonnet: 71,4 % pass@1, ~0,066 $ pro Aufgabe (API)
Ad

Technische Details und Einschränkungen

Das System ist laut Entwickler "höllisch langsam". Einfache Aufgaben dauern Sekunden, aber komplexe Programmierprobleme können bis zu einer Stunde in Anspruch nehmen. V3.1 wechselt zu Qwen 3.5 9B für verbesserte Geschwindigkeit und Parallelisierung.

ATLAS umfasst eine vollständige MaaS-Infrastruktur (Model-as-a-Service), die die Verbindung von OpenCode oder Claude Code über API ermöglicht. Der Entwickler empfiehlt mindestens 16 GB VRAM und warnt, dass es mit weniger Speicher "noch langsamer als erwähnt" sein wird.

Einrichtung und Reproduzierbarkeit

Das Projekt ist vollständig Open Source und hat keine kommerziellen Pläne. Das Repository ist verfügbar unter https://github.com/itigges22/ATLAS. Der Entwickler merkt an, dass die Reproduzierbarkeit noch verbessert werden muss, schlägt aber vor, dass "es gut funktionieren sollte, wenn Sie Claude Code bitten, es für Ihr Setup zu optimieren".

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Extrahieren von OpenClaw-Komponenten: Die Erfahrung eines Entwicklers mit Lane Queue und Speichersystem
Werkzeuge

Extrahieren von OpenClaw-Komponenten: Die Erfahrung eines Entwicklers mit Lane Queue und Speichersystem

Ein Entwickler versuchte, bestimmte Komponenten aus OpenClaw für den Einsatz in persönlichen KI-Agenten zu extrahieren, testete das Lane-Queue-Aufgabenausführungssystem und untersuchte das Memsearch-Speichersystem. Die Lane Queue wurde erfolgreich in Python unter Verwendung der Dokumentation neu implementiert, wobei Lücken in der Dokumentation und 13 Implementierungsprobleme aufgedeckt wurden.

OpenClawRadar
Sherlock: Apple-Entwicklerdokumentation als lokales MCP für Claude Code
Werkzeuge

Sherlock: Apple-Entwicklerdokumentation als lokales MCP für Claude Code

Sherlock indexiert 70.000 Apple API-Symbole in SQLite FTS5 und stellt 5 MCP-Tools sowie 3 automatisch auslösende Fähigkeiten bereit, um Claude Code in echten Dokumentationen zu verankern und Halluzinationen zu vermeiden.

OpenClawRadar
Fünf OpenClaw-Plugins, die zentrale Produktionsprobleme lösen
Werkzeuge

Fünf OpenClaw-Plugins, die zentrale Produktionsprobleme lösen

Ein Reddit-Nutzer identifiziert fünf OpenClaw-Plugins, die häufige Produktionsprobleme lösen: Manifest für Modell-Routing, Composio für Integrationsmanagement, Hyperspell für Speicher, Foundry für Workflow-Automatisierung und Opik für Tracing.

OpenClawRadar
Open-Source-Framework für persistente KI-Agenten-Speicherung mit lokaler Speicherung und graphenbasierter Abfrage
Werkzeuge

Open-Source-Framework für persistente KI-Agenten-Speicherung mit lokaler Speicherung und graphenbasierter Abfrage

Ein Entwickler baut ein Open-Source-Framework für persistente KI-Agenten-Speicherung, das Daten lokal als Markdown-Dateien speichert, Wiki-Links als Graphenkanten nutzt und Git für Versionskontrolle implementiert. Das System verfügt über eine Vier-Signal-Abruftechnik und grafikbewusstes Vergessen basierend auf der ACT-R-Kognitionswissenschaft.

OpenClawRadar