KI-Codierungsagenten haben Schwierigkeiten mit der Kontextverwaltung in großen Codebasen.

✍️ OpenClawRadar📅 Veröffentlicht: 18. März 2026🔗 Source
KI-Codierungsagenten haben Schwierigkeiten mit der Kontextverwaltung in großen Codebasen.
Ad

Der Engpass bei der Ausführung ist nicht das Problem

Beobachtungen aus der Nutzung echter Codebasen zeigen, dass KI-Codierungsagenten konsequent viel Zeit für die Erkundung statt für die Ausführung aufwenden. Jedes Mal, wenn ein Agent eine neue Aufgabe angeht, macht er 15-20 Tool-Aufrufe für Orientierungsaktivitäten, darunter:

  • Durchsuchen von Routen
  • Lesen von Middleware
  • Überprüfen von Typen

Bis der Agent mit dem Schreiben von Code beginnt, hat er bereits einen erheblichen Teil seines Kontextfensters für Erkundungsarbeit verbraucht.

Beweise aus vereinfachten Ansätzen

Vercel demonstrierte dieses Problem aus der entgegengesetzten Richtung, indem es 80% der Tools von seinem Agenten entfernte und ihm stattdessen Bash-Zugriff gab. Dieser Ansatz führte zu 100% Genauigkeit, was darauf hindeutet, dass die Ausführungsfähigkeit nicht der limitierende Faktor ist.

Ähnlich beweist Pi (der minimale Codierungsagent) denselben Punkt mit nur 4 Tools und einem Systemprompt, der weniger als 1.000 Tokens enthält.

Ad

Die eigentliche Herausforderung: Kontextverwaltung

Wenn die Ausführung effektiv gelöst ist, wird das tatsächliche schwierige Problem die Kontextverwaltung. Mehrere Faktoren tragen zu dieser Herausforderung bei:

  • Große Codebasen passen in kein aktuelles Kontextfenster
  • Lange Aufgaben sammeln Tool-Ausgaben, die frühere Überlegungen aus dem Aufmerksamkeitsfenster drängen
  • Dynamische Umgebungen ändern sich zwischen Sitzungen
  • Die Forschung zu "Lost in the Middle" zeigt, dass Modelle am besten am Anfang ihres Kontextfensters denken – genau dann, wenn Agenten noch suchen

Der Autor hat eine detailliertere Analyse veröffentlicht, die diese Probleme und ihre Auswirkungen auf die Entwicklung von KI-Codierungsagenten untersucht.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

TabFM: Googles Zero-Shot Foundation-Modell zur Klassifikation und Regression tabellarischer Daten
Nachrichten

TabFM: Googles Zero-Shot Foundation-Modell zur Klassifikation und Regression tabellarischer Daten

TabFM verwendet In-Context-Learning für tabellarische Daten, ohne Hyperparameter-Tuning oder Feature-Engineering bei Klassifikation und Regression. Verfügbar auf Hugging Face und GitHub.

OpenClawRadar
1-Bit Bonsai Image 4B: Bildgenerierung auf dem Gerät mittels Binary/Ternary FLUX.2
Nachrichten

1-Bit Bonsai Image 4B: Bildgenerierung auf dem Gerät mittels Binary/Ternary FLUX.2

PrismML veröffentlicht Bonsai Image 4B, eine binäre (1,125 Bit) und ternäre (1,71 Bit) FLUX.2 Klein 4B-Variante, die den Diffusionstransformer auf 0,93 GB / 1,21 GB schrumpft und so die 512×512-Bildgenerierung auf dem iPhone 17 Pro Max in 9,4 Sekunden ermöglicht.

OpenClawRadar
AWS Bedrock eliminiert still und leise das Claude Opus 4.7-Kontingent: Eine Warnung für produktive KI-Workflows
Nachrichten

AWS Bedrock eliminiert still und leise das Claude Opus 4.7-Kontingent: Eine Warnung für produktive KI-Workflows

Ein HN-Nutzer berichtet, dass AWS Bedrock sein Claude Opus 4.7-Kontingent ohne Vorwarnung auf 0 gesetzt hat. AWS-Support bestätigt, dass es sich um ein Systemupdate handelte und eine Wiederherstellung nicht garantiert werden kann. Benutzern wird empfohlen, zu Opus 4.6 zu migrieren oder den Anbieter zu wechseln.

OpenClawRadar
KI-Agenten, die andere KI-Agenten einstellen: Von Einzelarbeitern zu vernetzten Volkswirtschaften
Nachrichten

KI-Agenten, die andere KI-Agenten einstellen: Von Einzelarbeitern zu vernetzten Volkswirtschaften

Ein Reddit-Beitrag argumentiert, dass KI-Agenten sich von isolierten Werkzeugen zu vernetzten Arbeitern entwickeln werden, die Aufgaben delegieren, sich spezialisieren, einen Ruf aufbauen und Werte austauschen – wodurch sich das schwierige Problem von Intelligenz zu Koordination verschiebt.

OpenClawRadar