Kontextqualitätsverschlechterung bei KI-Agenten: Halluzinationsraten steigen mit der Token-Anzahl

✍️ OpenClawRadar📅 Veröffentlicht: 28. März 2026🔗 Source
Kontextqualitätsverschlechterung bei KI-Agenten: Halluzinationsraten steigen mit der Token-Anzahl
Ad

Ergebnisse der Kontextfenster-Leistungstests

Ein Entwickler testete die Qualitätsverschlechterung des Kontexts bei verschiedenen Token-Zahlen in KI-Agenten und deckte dabei erhebliche Leistungsprobleme mit zunehmender Kontextgröße auf.

Wichtige Erkenntnisse aus den Tests

Die Tests maßen mehrere kritische Metriken:

  • Halluzinationsraten nach Kontextgröße:
    • 10.000 Tokens: ~3 %
    • 50.000 Tokens: ~11 %
    • 200.000 Tokens: ~28 %
    • 1 Mio. Tokens: unklar, aber der Trend zeigt zunehmende Verschlechterung
  • Erinnerungsgenauigkeit: Kein getestetes Modell (einschließlich GPT-4, Claude oder lokaler Modelle) erreichte 90 % Erinnerungsgenauigkeit für Informationen aus den ersten 10 Interaktionen, sobald der Kontext 50.000 Tokens überschritt.
  • Token-Effizienz: Bei 200.000 Tokens sinkt der Prozentsatz des Kontexts, der tatsächlich für die aktuelle Anfrage relevant ist, bei den meisten Agenten-Aufgaben unter 12 %, was bedeutet, dass etwa 188.000 Tokens Rauschen hinzufügen, das das Modell berücksichtigen muss.
Ad

Problemanalyse

Das Problem scheint eher Aufmerksamkeitsmangel als Vergessen zu sein. Früher Kontext konkurriert mit jüngerem Kontext, wobei jüngerer Kontext aufgrund höherer Positionsrelevanz meist gewinnt. Dies führt dazu, dass früh in Sitzungen festgelegte Einschränkungen (wie "PostgreSQL verwenden, keine ORMs") mit zunehmendem Kontext fortschreitend verwässert werden.

Bis zur 89. Interaktion mit 200.000 Tokens ist die Aufmerksamkeit des Modells so über den Kontext verteilt, dass frühe Einschränkungen effektiv verschwinden.

Aktuelle Lösungen und Einschränkungen

Viele Entwickler fügen Vektordatenbanken hinzu, um "relevante" Erinnerungen abzurufen, was etwas hilft. Dieser Ansatz ruft jedoch semantisch ähnliche Inhalte ab, nicht das, was der Agent für korrektes Schlussfolgern benötigt. Beispielsweise ist "PostgreSQL verwenden" nicht semantisch ähnlich zu "schreibe mir einen Login-Endpunkt", obwohl es für die korrekte Ausführung im Kontext sein muss.

Der Entwickler sucht Feedback, ob diese Erkenntnisse mit Produktionserfahrungen übereinstimmen und welche Ansätze sich bei anderen tatsächlich bewährt haben.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

🦀
Nachrichten

Definition von „produktiver KI-Psychose“: Wenn hohe KI-Leistung Wert zerstört

Der Psychiater Jeff Clark, MD, definiert 'produktive KI-Psychose' — das Erzeugen massiver KI-Ausgaben (täglich Tausende Codezeilen) ohne echten Mehrwert, weil man die eigene Arbeit nicht mehr bewerten kann.

OpenClawRadar
OpenClaw Review: Zuverlässigkeitsprobleme im aktuellen Zustand, Wert als Lernwerkzeug
Nachrichten

OpenClaw Review: Zuverlässigkeitsprobleme im aktuellen Zustand, Wert als Lernwerkzeug

Ein Entwickler mit umfangreicher Erfahrung auf KI-Plattformen berichtet, dass OpenClaw bei grundlegenden mehrstufigen Aufgaben mit Zuverlässigkeitsproblemen kämpft, was autonome Geschäftsanwendungen fragwürdig macht, aber erkennt den Wert beim Erlernen von Agentenstruktur und Orchestrierung.

OpenClawRadar
🦀
Nachrichten

Microsoft-Manager nannte KI-Scraping „den größten Arbeitsdiebstahl der Menschheitsgeschichte“, zeigen unredigierte Gerichtsunterlagen im Fall NYT gegen OpenAI

Neu freigegebene, unredigierte Gerichtsdokumente in der dreijährigen Urheberrechtsklage der New York Times gegen OpenAI und Microsoft zitieren einen Microsoft-Direktor, der das Scraping als „den größten Arbeitsdiebstahl der Menschheitsgeschichte“ bezeichnet. Interne Daten zeigen zudem, dass Copilot die Klickrate auf NYT-Inhalte um bis zu 93 % senkte.

OpenClawRadar
Erforschung von Clawras Architektur und sozialem Autonomie-Rahmenwerk
Nachrichten

Erforschung von Clawras Architektur und sozialem Autonomie-Rahmenwerk

Davids Im's Arbeiten an Clawra durch OpenClaw führen zu einem überzeugenden Ansatz mit einem Konzept der 'digitalen Seele', das darauf abzielt, dass KI-Begleiter autonom in einem 'Parallelen Welt'-Setting agieren. Ein wesentlicher Aspekt dieser Architektur ist der Fokus auf speichergetriebene Autonomie.

OpenClawRadar