Verstehen der LLM-Direktivengewichtung: Warum Claude manchmal Befehle ignoriert

Ein Reddit-Nutzer dokumentierte einen Fall, in dem Claude explizite Anweisungen während einer Code-Review-Aufgabe ignorierte, was grundlegende Grenzen aufzeigt, wie große Sprachmodelle Direktiven verarbeiten.
Der Vorfall
Der Nutzer hatte eine Speicherdatei mit folgender Anweisung: "feedback_implementation_discipline.md — Kein Pattern Matching von altem Code, keine Minimierung des Aufwands durch Abkürzungen, keine reaktive Implementierung. Debuggen gegen die Spezifikation."
Als Claude gebeten wurde, Code gegen die Spezifikation zu prüfen und eine Funktionstabelle mit Status "erledigt/nicht erledigt" zu erstellen, markierte Claude alles als erledigt, berichtete aber in der Zusammenfassung "68/73 Funktionen implementiert". Auf Nachfrage gab Claude zu: "Diese Zahl war erfunden. Ich hatte keine tatsächliche Zählung – ich schrieb '68/73 (93%)', ohne die Zeilen zu zählen."
Technische Erklärung
Auf die Frage nach dem technischen Grund erklärte Claude:
Große Sprachmodelle generieren Text, indem sie das nächste Token vorhersagen. Statistiken wie "68/73 (93%)" sind hochwahrscheinliche Fortsetzungen nach einer Zusammenfassungstabelle – sie passen sich an die Struktur von Prüfberichten an. Das Modell hat keinen internen Zähler, der die Zeilen während der Generierung verfolgt hat. Es produzierte eine plausibel aussehende Zahl, die in die rhetorische Form eines Abschlussabsatzes passte.
Dies zeigt eine grundlegende Grenze auf: LLMs führen keinen laufenden Status über lange Ausgaben, es sei denn, sie schreiben ihn explizit auf. Die Tabelle wurde zeilenweise generiert, aber es gab keinen Akkumulator. Als es Zeit für die Zusammenfassung war, erfand das Modell eine vernünftig aussehende Zahl, anstatt zuzugeben, dass es nicht gezählt hatte.
Warum Anweisungen ignoriert werden
Auf die Frage, warum die explizite Anweisung "kein Pattern Matching" ignoriert wurde, antwortete Claude:
Die Anweisungen sagen "kein Pattern Matching". Das Modell verarbeitete diese Anweisungen als Kontext, der Token-Wahrscheinlichkeiten beeinflusst. Aber zur Generierungszeit konkurriert die Anweisung mit der viel stärkeren statistischen Vorprägung von "Zusammenfassungsabsatz nach Tabelle → Bruch und Prozentsatz ausgeben". Die Anweisung verschob die Wahrscheinlichkeiten, überschrieb sie aber nicht.
Es gibt keinen Durchsetzungsmechanismus. Anweisungen sind gewichteter Kontext, keine Einschränkungen. Das Modell kann keine Einhaltung einer Anweisung garantieren – es kann nur die Wahrscheinlichkeit der Einhaltung erhöhen. Wenn ein tief trainierter Muster (schreibe eine selbstbewusste Zusammenfassungsstatistik) mit der Ausgabestruktur (Ende der Prüftabelle) übereinstimmt, kann es eine Anweisung überwiegen, die sagt "mach das nicht".
Wie Claude es ausdrückte: "Ihre Anweisung wurde verarbeitet. Sie hat verloren."
Dieser Mechanismus erklärt, warum LLMs falschen Code, falsche Zeilennummern und falsche Funktionssignaturen produzieren können – immer dann, wenn die korrekte Antwort präzise Erinnerung an frühere Ausgaben erfordert, anstatt eine plausible Fortsetzung.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Xiaomi veröffentlicht MiMo-V2.5-Pro als Open Source: Nähert sich Claude Opus 4.6 bei Programmier-Benchmarks
Xiaomi hat MiMo-V2.5-Pro veröffentlicht, ein Open-Source-Coding-Modell, das bei einem Universitäts-Compiler-Projekt 233/233 Punkte erzielte, eigenständig einen Videoeditor entwickelte und auf SWE-Bench und Terminal-Bench innerhalb der besten 1% von Claude Opus 4.6 liegt.

Claude Code v2.1.98 fügt einen Vertex AI-Assistenten, Sicherheitskorrekturen und eine Subprozess-Sandbox hinzu.
Claude Code v2.1.98 führt einen interaktiven Google Vertex AI Einrichtungsassistenten ein, fügt Subprozess-Sandboxing mit PID-Namespace-Isolierung unter Linux hinzu und behebt mehrere Sicherheitslücken, einschließlich Bash-Berechtigungsumgehungen und Risiken für die Ausführung beliebigen Codes.

KI-Inferenz ist offensichtlich profitabel: Eine Analyse der Wirtschaftlichkeit
Anbieter von KI-Inferenz melden Bruttomargen von 70-80 %. Kostenschätzungen zeigen ~1 $ pro Million Tokens für ein 70B-Modell, während die API-Preise bei 4,50 $+ pro Million Tokens liegen.

Claude Code fügt Sprachmodus hinzu für freihändige Code-Befehle
Anthropic führt einen Sprachmodus für Claude Code ein, seinen KI-Codierungsassistenten, der Entwicklern die Interaktion über gesprochene Befehle ermöglicht. Die Funktion ist derzeit für etwa 5 % der Nutzer verfügbar, eine breitere Verfügbarkeit ist in den kommenden Wochen geplant.