Code-Evolution-Methode verdreifacht die Leistung von LLM im ARC-AGI-2-Benchmark

✍️ OpenClawRadar📅 Veröffentlicht: 28. Februar 2026🔗 Source
Code-Evolution-Methode verdreifacht die Leistung von LLM im ARC-AGI-2-Benchmark
Ad

Code-Evolution verbessert das LLM-Schlussfolgern bei ARC-AGI-2

Forscher von Imbue haben Ergebnisse veröffentlicht, die zeigen, wie Code-Evolution die LLM-Leistung auf dem ARC-AGI-2-Benchmark erheblich verbessern kann. Ihre Methode kombiniert Fitness-basiertes Sampling und Code-Mutation, gesteuert durch ein Basis-LLM, und erzielt deutliche Gewinne über verschiedene Modelltypen hinweg.

Leistungsergebnisse

Die Evolutionsmethode erbringt je nach Basismodell unterschiedliche Verbesserungen:

  • Kimi K2.5 (Open-Weights): 2,8-facher Leistungsgewinn, von 12,1 % auf 34,0 % Genauigkeit auf dem öffentlichen Evaluierungssatz, bei 2,67 US-Dollar pro Aufgabe. Dies stellt die derzeit leistungsstärkste Open-Source-/Open-Weights-Lösung für ARC-AGI-2 dar.
  • Gemini 3 Flash: 1,8-facher Leistungsgewinn, von 34,0 % auf 61,4 % Genauigkeit, bei 2,42 US-Dollar pro Aufgabe.
  • Gemini 3.1 Pro: Verbesserung von 88,1 % auf 95,1 % Genauigkeit, bei 8,71 US-Dollar pro Aufgabe. Dieses Ergebnis ist wettbewerbsfähig mit dem aktuellen Stand der Technik (97,9 % bei 11,77 US-Dollar/Aufgabe von Confluence Lab).

Alle Durchläufe verwendeten exakt denselben Evolutionsrahmen und dieselben Prompts. Die Forscher weisen darauf hin, dass die Ergebnisse auf dem für diese Ergebnisse verwendeten öffentlichen Evaluierungssatz nicht direkt mit dem halbprivaten Datensatz vergleichbar sind, der für die offizielle ARC-AGI-2-Rangliste verwendet wird.

Ad

Wie Code-Evolution funktioniert

Die Methode verbessert iterativ eine anfängliche Lösung durch Fitness-basiertes Sampling und Code-Mutation. Der Mutationsschritt wird von einem zugrundeliegenden Basis-LLM gesteuert, ist jedoch unabhängig vom gewählten spezifischen Modell. Dieser Ansatz kann auf eine breite Palette von Schlussfolgerungs- und Optimierungsaufgaben jenseits von ARC-AGI-2 angewendet werden.

Zum Kontext: ARC-AGI (Abstraction and Reasoning Corpus) wurde 2019 von François Chollet vorgeschlagen, um die „allgemeine fluide Intelligenz“ zu messen – die Fähigkeit eines Systems, effizient Lösungen für neuartige Probleme zu lernen. Jede Aufgabe präsentiert 2–5 Eingabe-/Ausgabebeispiele (rechteckige Raster mit Farbwerten) und erfordert die Ableitung von Transformationsregeln, um Ausgaben für Herausforderungseingaben vorherzusagen.

📖 Read the full source: HN LLM Tools

Ad

👀 Siehe auch

Claude Code unterstützt jetzt über 240 Modelle über das NVIDIA NIM Gateway – darunter Nemotron-3 120B für agentisches Programmieren
Werkzeuge

Claude Code unterstützt jetzt über 240 Modelle über das NVIDIA NIM Gateway – darunter Nemotron-3 120B für agentisches Programmieren

Claude Code kann während einer Sitzung über den Befehl /model auf über 240 NVIDIA NIM Modelle umschalten. Die Denkvariante von Nemotron-3 Super 120B zeigt starke Ergebnisse bei der Umstrukturierung mehrerer Dateien und agentischen Aufgaben.

OpenClawRadar
Mia: Lokaler KI-Arbeitsbereich-Daemon mit nativer Android-App und P2P-Streaming
Werkzeuge

Mia: Lokaler KI-Arbeitsbereich-Daemon mit nativer Android-App und P2P-Streaming

Mia ist ein Daemon, der auf Ihrem Computer läuft und sich über P2P mit einer nativen Android-App verbindet, sodass Sie langlaufende KI-Codierungsaufgaben von Ihrem Handy aus starten und überwachen können. Er unterstützt OpenCode, Claude Code, Gemini CLI und Codex-Agenten und streamt die Ausgabe in Echtzeit direkt auf Ihr Gerät.

OpenClawRadar
Rift CLI: Verwalten Sie Git Worktrees für parallele KI-Agenten-Workflows
Werkzeuge

Rift CLI: Verwalten Sie Git Worktrees für parallele KI-Agenten-Workflows

Rift ist ein CLI-Tool, das isolierte Git-Worktrees und Branches erstellt, um mehrere KI-Coding-Agenten wie Claude Code gleichzeitig im selben Repository auszuführen. Es umfasst Lifecycle-Hooks, deterministisches Port-Mapping und Multi-Editor-Workspace-Unterstützung.

OpenClawRadar
Auto Router vs Sonnet: Kosteneinsparungen vs Antwortqualität
Werkzeuge

Auto Router vs Sonnet: Kosteneinsparungen vs Antwortqualität

Die Auto Router-Funktion von Open Router wählt LLMs dynamisch basierend auf der Kontextkomplexität aus und bietet erhebliche Kosteneinsparungen (0,8 Cent vs. 0,00071 Cent pro Anfrage), aber Nutzer berichten von einer verschlechterten Antwortqualität im Vergleich zu Sonnet 4.6.

OpenClawRadar