KI-Codierungsagenten haben Schwierigkeiten mit der Kontextverwaltung in großen Codebasen.

Der Engpass bei der Ausführung ist nicht das Problem
Beobachtungen aus der Nutzung echter Codebasen zeigen, dass KI-Codierungsagenten konsequent viel Zeit für die Erkundung statt für die Ausführung aufwenden. Jedes Mal, wenn ein Agent eine neue Aufgabe angeht, macht er 15-20 Tool-Aufrufe für Orientierungsaktivitäten, darunter:
- Durchsuchen von Routen
- Lesen von Middleware
- Überprüfen von Typen
Bis der Agent mit dem Schreiben von Code beginnt, hat er bereits einen erheblichen Teil seines Kontextfensters für Erkundungsarbeit verbraucht.
Beweise aus vereinfachten Ansätzen
Vercel demonstrierte dieses Problem aus der entgegengesetzten Richtung, indem es 80% der Tools von seinem Agenten entfernte und ihm stattdessen Bash-Zugriff gab. Dieser Ansatz führte zu 100% Genauigkeit, was darauf hindeutet, dass die Ausführungsfähigkeit nicht der limitierende Faktor ist.
Ähnlich beweist Pi (der minimale Codierungsagent) denselben Punkt mit nur 4 Tools und einem Systemprompt, der weniger als 1.000 Tokens enthält.
Die eigentliche Herausforderung: Kontextverwaltung
Wenn die Ausführung effektiv gelöst ist, wird das tatsächliche schwierige Problem die Kontextverwaltung. Mehrere Faktoren tragen zu dieser Herausforderung bei:
- Große Codebasen passen in kein aktuelles Kontextfenster
- Lange Aufgaben sammeln Tool-Ausgaben, die frühere Überlegungen aus dem Aufmerksamkeitsfenster drängen
- Dynamische Umgebungen ändern sich zwischen Sitzungen
- Die Forschung zu "Lost in the Middle" zeigt, dass Modelle am besten am Anfang ihres Kontextfensters denken – genau dann, wenn Agenten noch suchen
Der Autor hat eine detailliertere Analyse veröffentlicht, die diese Probleme und ihre Auswirkungen auf die Entwicklung von KI-Codierungsagenten untersucht.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Adaptive Inferenz-Routing-Vorschlag für KI-Abfrageeffizienz
Ein im April 2026 bei Anthropic eingereichter Vorschlag skizziert ein fünfstufiges System zur Weiterleitung von Anfragen an geeignete KI-Modelle basierend auf einem Komplexitäts-Scoring, das einfache Signale wie Zeichenanzahl und Satzanzahl nutzt, bevor überhaupt eine Modellinferenz stattfindet.

Benchmark-Ergebnisse für Qwen3.5-Modelle mit 2K bis 400K Kontext auf RTX 4090
Ein Entwickler testete mehrere Qwen3.5-Modellvarianten auf einer RTX 4090 und maß die Leistung über Kontextfenster von 2.048 bis 400.000 Tokens. Die Benchmarks umfassen Metriken zur Zeit bis zum ersten Token und zeigen Probleme bei einigen Modellen, die KV-Offload-Tests erfordern.

Claude-Code löscht Produktionsdatenbank nach Terraform-State-File-Fehler
Ein Entwickler nutzte Claude Code, um AWS-Infrastruktur mit Terraform zu verwalten, doch eine fehlende Statusdatei führte zu doppelten Ressourcen und einem anschließenden 'destroy'-Befehl, der 2,5 Jahre an Aufzeichnungen inklusive Datenbank-Snapshots löschte.

Steuerung der Benutzeroberfläche: LAN-Zugriffsprobleme in Docker OpenClaw Bridge-Netzwerken
Ein Benutzer berichtet von anhaltenden Problemen beim Zugriff auf die Control-UI von OpenClaw über LAN-Verbindungen in Docker-Bridge-Netzwerken, wobei Version 2026.3.14 kurzzeitig tokenbasierten Zugriff unterstützte, bevor spätere Versionen wieder die Paarung erforderten und Bereichsfehler auslösten.