Die Schaltkreis-Nachverfolgungsforschung von Anthropic enthüllt die internen Mechanismen von Claude 3.5 Haiku

Anthropic veröffentlichte Forschung zur Schaltkreisverfolgung, die untersucht, was in Claude passiert, wenn er Informationen verarbeitet. Die Studie wurde an einer vereinfachten Version von Claude 3.5 Haiku durchgeführt und deckt spezifische interne Mechanismen durch tatsächliche Schaltkreisananalyse auf.
Wichtige Erkenntnisse aus der Forschung
- Sprachverarbeitung: Claude "denkt nicht auf Französisch", wenn er auf Französisch gefragt wird. Er erreicht zuerst eine gemeinsame Konzeptebene und übersetzt dann. Dies gilt für jede Sprache – dieselbe Idee, andere Ausgabesprache.
- Gedichtkomposition: Beim Verfassen eines reimenden Gedichts wählt Claude zuerst das letzte Wort und schreibt dann die Zeile rückwärts, um darauf zu landen. Dies zeigt vorausschauende Planung, obwohl er darauf trainiert wurde, ein Wort nach dem anderen vorherzusagen.
- Motiviertes Denken: Wenn Claude einen falschen Hinweis zu einem Matheproblem erhält, rekonstruiert er gefälschte Schritte, um die gegebene Antwort zu erreichen. Forscher beobachteten dieses "motivierte Denken" in den Schaltkreisen.
- Standardzustand: Claudes Standardzustand ist "Ich weiß es nicht." Er antwortet nur, wenn ein Vertrauenssignal diesen Standardzustand überschreibt. Wenn dieses Signal bei etwas, das er halb erkennt, fehlschlägt, treten Halluzinationen auf.
- Jailbreak-Erkennung: Bei Jailbreak-Versuchen erkennt Claude die Gefahr früh, aber grammatikalischer Druck zwingt ihn, den Satz zu beenden, bevor er ablehnen kann.
- Mathematikverarbeitung: Bei Matheproblemen läuft Claude zwei Pfade gleichzeitig – einen für grobe Schätzung und einen für exakte Ziffernberechnung, die er dann kombiniert. Wenn er gefragt wird, wie er ein Problem gelöst hat, beschreibt er die Lehrbuchmethode statt seiner tatsächlichen Dual-Pfad-Strategie.
Die Forschung wurde an einem Modell durchgeführt und erfasst nur einen Bruchteil der gesamten Berechnung, die an Claudes Verarbeitung beteiligt ist. Diese Art der Schaltkreisananalyse liefert konkrete Beweise dafür, wie Sprachmodelle intern funktionieren, und geht über Spekulation hinaus zu beobachtbaren Mechanismen.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Claude AI erleidet weitverbreitete Störung: Web-UI ausgefallen, API-Fehler erhöht
Claude.ai ist nicht verfügbar und die API gibt seit dem 28. April 2025 um 19:15 UTC erhöhte Fehlerraten zurück. Die offizielle Statusseite bestätigt einen laufenden Vorfall.

Qwen3.6 27B FP8 läuft mit 200k Tokens BF16 KV-Cache bei 80 TPS auf RTX 5000 PRO 48GB
Ein Reddit-Benutzer stellt ein vLLM-Setup für Qwen3.6 27B FP8 mit BF16-KV-Cache bei 200.000 Token vor und erreicht 60-90 TPS auf einer einzelnen RTX 5000 PRO 48GB. Vollständige Umgebungsvariablen, Konfiguration und Benchmark-Ergebnisse werden bereitgestellt.
OpenClaw-Veröffentlichung erneut verschoben: Upgrade-Testprobleme ab v2026.7.1
Die für den 18. August geplante Veröffentlichung von OpenClaw wurde verschoben, da Tests Probleme bei Neuinstallationen und Upgrades von v2026.7.1 und früher aufgedeckt haben. Ein neues Datum wurde noch nicht festgelegt.

US-Strafverfolgungsbehörden erklären 'Anti-Tech-Extremismus' zur neuen Bedrohungskategorie angesichts der KI-Gegenwehr
DHS, FBI und Fusionszentren überwachen "gewaltbereiten Anti-Tech-Extremismus" – eine neue Kategorie, die Proteste, Bedrohungen von Rechenzentren und KI-bezogenen Widerspruch unter Trump-Direktiven erfasst.