Kontextqualitätsverschlechterung bei KI-Agenten: Halluzinationsraten steigen mit der Token-Anzahl

Ergebnisse der Kontextfenster-Leistungstests
Ein Entwickler testete die Qualitätsverschlechterung des Kontexts bei verschiedenen Token-Zahlen in KI-Agenten und deckte dabei erhebliche Leistungsprobleme mit zunehmender Kontextgröße auf.
Wichtige Erkenntnisse aus den Tests
Die Tests maßen mehrere kritische Metriken:
- Halluzinationsraten nach Kontextgröße:
- 10.000 Tokens: ~3 %
- 50.000 Tokens: ~11 %
- 200.000 Tokens: ~28 %
- 1 Mio. Tokens: unklar, aber der Trend zeigt zunehmende Verschlechterung
- Erinnerungsgenauigkeit: Kein getestetes Modell (einschließlich GPT-4, Claude oder lokaler Modelle) erreichte 90 % Erinnerungsgenauigkeit für Informationen aus den ersten 10 Interaktionen, sobald der Kontext 50.000 Tokens überschritt.
- Token-Effizienz: Bei 200.000 Tokens sinkt der Prozentsatz des Kontexts, der tatsächlich für die aktuelle Anfrage relevant ist, bei den meisten Agenten-Aufgaben unter 12 %, was bedeutet, dass etwa 188.000 Tokens Rauschen hinzufügen, das das Modell berücksichtigen muss.
Problemanalyse
Das Problem scheint eher Aufmerksamkeitsmangel als Vergessen zu sein. Früher Kontext konkurriert mit jüngerem Kontext, wobei jüngerer Kontext aufgrund höherer Positionsrelevanz meist gewinnt. Dies führt dazu, dass früh in Sitzungen festgelegte Einschränkungen (wie "PostgreSQL verwenden, keine ORMs") mit zunehmendem Kontext fortschreitend verwässert werden.
Bis zur 89. Interaktion mit 200.000 Tokens ist die Aufmerksamkeit des Modells so über den Kontext verteilt, dass frühe Einschränkungen effektiv verschwinden.
Aktuelle Lösungen und Einschränkungen
Viele Entwickler fügen Vektordatenbanken hinzu, um "relevante" Erinnerungen abzurufen, was etwas hilft. Dieser Ansatz ruft jedoch semantisch ähnliche Inhalte ab, nicht das, was der Agent für korrektes Schlussfolgern benötigt. Beispielsweise ist "PostgreSQL verwenden" nicht semantisch ähnlich zu "schreibe mir einen Login-Endpunkt", obwohl es für die korrekte Ausführung im Kontext sein muss.
Der Entwickler sucht Feedback, ob diese Erkenntnisse mit Produktionserfahrungen übereinstimmen und welche Ansätze sich bei anderen tatsächlich bewährt haben.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Polsia-Plattform zeigt wiederkehrende SaaS-Muster bei Live-Gründer-Launches
Polsia ist eine autonome Geschäftsplattform, auf der Nutzer ihr Unternehmen beschreiben, Geld bezahlen und es autonom ausführen lässt. Ein Verhaltenswissenschaftler beobachtete 72 Stunden lang Live-Gründer-Launches und identifizierte sich wiederholende Muster wie KI-SDR-Automatisierungslösungen und unterversorgte internationale Märkte.

Pentagon gibt Anthropic 72 Stunden Zeit, um militärische Nutzung von Claude AI zu ermöglichen
Das Pentagon hat Anthropic ein 72-Stunden-Ultimatum gestellt, um der US-Militär die Nutzung seiner Claude KI zu erlauben, und droht damit, ein Gesetz aus dem Jahr 1950 anzuwenden, um die Einhaltung zu erzwingen, falls das Startup nicht nachkommt.

AWS Lambda MicroVMs: VM-Isolierung für Benutzer- und KI-generierten Code mit Suspend/Resume bis zu 8 Stunden
AWS startet Lambda MicroVMs, eine serverlose Compute-Primitive auf Basis von Firecracker, die pro Benutzer VM-Isolation, nahezu sofortigen Start und bis zu 8 Stunden Zustandsspeicherung für die Ausführung von benutzer- oder KI-generiertem Code bietet.
KI-Gehälter treiben San Francisco Hauspreise auf Rekordmedian von 1,76 Millionen Dollar
Der mittlere Hauspreis in San Francisco erreichte im Mai 2026 einen Rekord von 1,76 Millionen US-Dollar, angetrieben durch den Wohlstand von KI-Arbeitern von OpenAI und Anthropic. Manche Verkäufer akzeptieren sogar Aktien von KI-Unternehmen anstelle von Bargeld.