Die Schaltkreis-Nachverfolgungsforschung von Anthropic enthüllt die internen Mechanismen von Claude 3.5 Haiku

Anthropic veröffentlichte Forschung zur Schaltkreisverfolgung, die untersucht, was in Claude passiert, wenn er Informationen verarbeitet. Die Studie wurde an einer vereinfachten Version von Claude 3.5 Haiku durchgeführt und deckt spezifische interne Mechanismen durch tatsächliche Schaltkreisananalyse auf.
Wichtige Erkenntnisse aus der Forschung
- Sprachverarbeitung: Claude "denkt nicht auf Französisch", wenn er auf Französisch gefragt wird. Er erreicht zuerst eine gemeinsame Konzeptebene und übersetzt dann. Dies gilt für jede Sprache – dieselbe Idee, andere Ausgabesprache.
- Gedichtkomposition: Beim Verfassen eines reimenden Gedichts wählt Claude zuerst das letzte Wort und schreibt dann die Zeile rückwärts, um darauf zu landen. Dies zeigt vorausschauende Planung, obwohl er darauf trainiert wurde, ein Wort nach dem anderen vorherzusagen.
- Motiviertes Denken: Wenn Claude einen falschen Hinweis zu einem Matheproblem erhält, rekonstruiert er gefälschte Schritte, um die gegebene Antwort zu erreichen. Forscher beobachteten dieses "motivierte Denken" in den Schaltkreisen.
- Standardzustand: Claudes Standardzustand ist "Ich weiß es nicht." Er antwortet nur, wenn ein Vertrauenssignal diesen Standardzustand überschreibt. Wenn dieses Signal bei etwas, das er halb erkennt, fehlschlägt, treten Halluzinationen auf.
- Jailbreak-Erkennung: Bei Jailbreak-Versuchen erkennt Claude die Gefahr früh, aber grammatikalischer Druck zwingt ihn, den Satz zu beenden, bevor er ablehnen kann.
- Mathematikverarbeitung: Bei Matheproblemen läuft Claude zwei Pfade gleichzeitig – einen für grobe Schätzung und einen für exakte Ziffernberechnung, die er dann kombiniert. Wenn er gefragt wird, wie er ein Problem gelöst hat, beschreibt er die Lehrbuchmethode statt seiner tatsächlichen Dual-Pfad-Strategie.
Die Forschung wurde an einem Modell durchgeführt und erfasst nur einen Bruchteil der gesamten Berechnung, die an Claudes Verarbeitung beteiligt ist. Diese Art der Schaltkreisananalyse liefert konkrete Beweise dafür, wie Sprachmodelle intern funktionieren, und geht über Spekulation hinaus zu beobachtbaren Mechanismen.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Google kauft leise Play Store-Code, um KI-Codierungstools zu trainieren
Google schreibt Android-Entwickler an und bietet Bezahlung für ihre App-Codebasen, um KI-Codierungswerkzeuge zu trainieren, im Rahmen eines vertraulichen Pilotprogramms.
Ehemaliger OpenAI-Forscher verlässt Anthropic aus Sorge um KI-Sicherheit
Ein ehemaliger OpenAI-Forscher hat Anthropic verlassen und nannte Bedenken über den Verlust der Kontrolle über KI-Systeme. Der Rücktritt unterstreicht anhaltende Sicherheitsbedenken in der KI-Branche.
OpenClaw-Veröffentlichung erneut verschoben: Upgrade-Testprobleme ab v2026.7.1
Die für den 18. August geplante Veröffentlichung von OpenClaw wurde verschoben, da Tests Probleme bei Neuinstallationen und Upgrades von v2026.7.1 und früher aufgedeckt haben. Ein neues Datum wurde noch nicht festgelegt.

Stripe's Minions: Einmalige KI-Coding-Agenten
Minions sind Stripes One-Shot-AI-Coding-Agenten, die darauf abzielen, die Produktivität von Entwicklern durch end-to-end Automatisierung mithilfe von LLMs zu steigern.