ETH-Zürich-Studie: Übermäßiger Kontext verringert die Leistung von KI-Code-Agenten

✍️ OpenClawRadar📅 Veröffentlicht: 8. März 2026🔗 Source
ETH-Zürich-Studie: Übermäßiger Kontext verringert die Leistung von KI-Code-Agenten
Ad

Eine aktuelle Studie der ETH Zürich liefert konkrete Beweise dafür, dass mehr Kontext nicht unbedingt zu besserer Leistung bei KI-Coding-Agenten führt. Die Forschung testete vier Coding-Agenten an 138 echten GitHub-Aufgaben mit klaren quantitativen Ergebnissen.

Wichtige Erkenntnisse

Die Studie zeigte, dass LLM-generierte Kontextdateien die Erfolgsquote um 2-3 % senkten, während die Inferenzkosten um 20 % stiegen. Selbst von Menschen geschriebene Kontextdateien verbesserten den Erfolg nur um etwa 4 %, bei gleichzeitig erheblichen Kostensteigerungen.

Das Kernproblem

Die Forscher entdeckten, dass Agenten jede Anweisung in Kontextdateien als etwas behandelten, das ausgeführt werden muss. In einem Experiment verbesserte sich die Leistung wieder, als sie Repositories auf nur die generierte Kontextdatei reduzierten. Dies zeigt, dass Agenten Schwierigkeiten haben, zwischen wesentlichen Anweisungen und irrelevanten historischen Informationen zu unterscheiden.

Ad

Praktische Empfehlungen

Die Studie empfiehlt, nur Informationen einzubeziehen, die der Agent wirklich nicht selbst entdecken kann, und den Kontext minimal zu halten. Dies ist besonders relevant für Kommunikationsdaten wie E-Mail-Threads, die wie Kontext aussehen mögen, aber oft als Anweisungen interpretiert werden, obwohl es sich tatsächlich um historisches Rauschen handelt.

Context-API-Lösung

Um dieses Problem anzugehen, entwickelten die Forscher eine Context-API (iGPT), die sich auf die E-Mail-Verarbeitung konzentriert. Die API:

  • Rekonstruiert E-Mail-Threads in Konversationsgraphen, bevor der Kontext das Modell erreicht
  • Dedupliziert zitierte Texte
  • Erkennt, wer was und wann gesagt hat
  • Gibt strukturiertes JSON statt Rohtext zurück

Dieser Ansatz stellt sicher, dass Agenten gefilterten Kontext statt gesamter Konversationsverläufe erhalten, was ihre Fähigkeit verbessert, sich auf relevante Informationen zu konzentrieren.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

KI-Agenten definieren: Der Workflow-Test
Nachrichten

KI-Agenten definieren: Der Workflow-Test

Eine Reddit-Diskussion stellt die Frage, ob viele KI-Agenten-Produkte im Wesentlichen Chatbots mit einer Aufgabenliste sind, und schlägt einen Test vor, der auf ihrer Fähigkeit basiert, Arbeitsabläufe über mehrere Tools hinweg ohne manuelles Eingreifen abzuschließen.

OpenClawRadar
Meta stoppt internes KI-Trainingsprogramm nach Datenleck mit Tastenanschlägen von Mitarbeitern
Nachrichten

Meta stoppt internes KI-Trainingsprogramm nach Datenleck mit Tastenanschlägen von Mitarbeitern

Meta pausiert das MCI-Programm zur Aufzeichnung von Tastatureingaben nach einem SEV-2-Leck, das private Gespräche, Leistungsdaten und Transkriptionen unternehmensweit offenlegte.

OpenClawRadar
Die Analyse der Inferenzpreise zeigt eine 4,4-fache Preisspanne für dasselbe Modell bei verschiedenen Anbietern.
Nachrichten

Die Analyse der Inferenzpreise zeigt eine 4,4-fache Preisspanne für dasselbe Modell bei verschiedenen Anbietern.

Die Analyse der Inferenzpreise für Llama 3.1 70B Instruct zeigt eine 4,4-fache Kostenunterschied zwischen Anbietern, mit DeepInfra bei 0,20 $/0,27 $ pro Million Tokens und Together bei 0,88 $/0,88 $. Bei Reasoning-Modellen erreicht die Spanne etwa das 30-fache zwischen DeepSeek R1 und OpenAI o1.

OpenClawRadar
Kimi K2.6 schlägt Claude, GPT-5.5 und Gemini bei Programmierherausforderung mit aggressiver Gleitstrategie
Nachrichten

Kimi K2.6 schlägt Claude, GPT-5.5 und Gemini bei Programmierherausforderung mit aggressiver Gleitstrategie

Beim Word Gem Puzzle des AI Coding Contest am 12. Tag erzielte Moonshot AIs Open-Weights-Modell Kimi K2.6 22 Matchpunkte (7-1-0) und übertraf damit GPT-5.5 (16), Claude Opus 4.7 (12) und Gemini Pro 3.1 (9). MiMo V2-Pro wurde Zweiter. Kimi gewann durch aggressives Verschieben.

OpenClawRadar