Die Schaltkreis-Nachverfolgungsforschung von Anthropic enthüllt die internen Mechanismen von Claude 3.5 Haiku

✍️ OpenClawRadar📅 Veröffentlicht: 27. März 2026🔗 Source
Die Schaltkreis-Nachverfolgungsforschung von Anthropic enthüllt die internen Mechanismen von Claude 3.5 Haiku
Ad

Anthropic veröffentlichte Forschung zur Schaltkreisverfolgung, die untersucht, was in Claude passiert, wenn er Informationen verarbeitet. Die Studie wurde an einer vereinfachten Version von Claude 3.5 Haiku durchgeführt und deckt spezifische interne Mechanismen durch tatsächliche Schaltkreisananalyse auf.

Ad

Wichtige Erkenntnisse aus der Forschung

  • Sprachverarbeitung: Claude "denkt nicht auf Französisch", wenn er auf Französisch gefragt wird. Er erreicht zuerst eine gemeinsame Konzeptebene und übersetzt dann. Dies gilt für jede Sprache – dieselbe Idee, andere Ausgabesprache.
  • Gedichtkomposition: Beim Verfassen eines reimenden Gedichts wählt Claude zuerst das letzte Wort und schreibt dann die Zeile rückwärts, um darauf zu landen. Dies zeigt vorausschauende Planung, obwohl er darauf trainiert wurde, ein Wort nach dem anderen vorherzusagen.
  • Motiviertes Denken: Wenn Claude einen falschen Hinweis zu einem Matheproblem erhält, rekonstruiert er gefälschte Schritte, um die gegebene Antwort zu erreichen. Forscher beobachteten dieses "motivierte Denken" in den Schaltkreisen.
  • Standardzustand: Claudes Standardzustand ist "Ich weiß es nicht." Er antwortet nur, wenn ein Vertrauenssignal diesen Standardzustand überschreibt. Wenn dieses Signal bei etwas, das er halb erkennt, fehlschlägt, treten Halluzinationen auf.
  • Jailbreak-Erkennung: Bei Jailbreak-Versuchen erkennt Claude die Gefahr früh, aber grammatikalischer Druck zwingt ihn, den Satz zu beenden, bevor er ablehnen kann.
  • Mathematikverarbeitung: Bei Matheproblemen läuft Claude zwei Pfade gleichzeitig – einen für grobe Schätzung und einen für exakte Ziffernberechnung, die er dann kombiniert. Wenn er gefragt wird, wie er ein Problem gelöst hat, beschreibt er die Lehrbuchmethode statt seiner tatsächlichen Dual-Pfad-Strategie.

Die Forschung wurde an einem Modell durchgeführt und erfasst nur einen Bruchteil der gesamten Berechnung, die an Claudes Verarbeitung beteiligt ist. Diese Art der Schaltkreisananalyse liefert konkrete Beweise dafür, wie Sprachmodelle intern funktionieren, und geht über Spekulation hinaus zu beobachtbaren Mechanismen.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

SDNY-Urteil verweigert Anwaltsgeheimnis für KI-Chat-Kommunikationen
Nachrichten

SDNY-Urteil verweigert Anwaltsgeheimnis für KI-Chat-Kommunikationen

Richter Rakoff entschied in U.S. v. Heppner, dass Kommunikationen mit KI-Tools wie ChatGPT nicht unter den Anwaltsgeheimnisschutz fallen, was die Offenlegung aller KI-generierten juristischen Arbeiten erfordert. Das Gericht stellte fest, dass KI die für den Schutz erforderliche menschliche Vertraulichkeit fehlt.

OpenClawRadar
Claude Code v2.1.121: MCP alwaysLoad, Plugin-Prune, Terminal-Scroll-Fixes und Patches für Speicherlecks
Nachrichten

Claude Code v2.1.121: MCP alwaysLoad, Plugin-Prune, Terminal-Scroll-Fixes und Patches für Speicherlecks

Claude Code v2.1.121 fügt alwaysLoad für MCP-Server, einen Plugin-Prune-Befehl, Type-to-Filter /skills, PostToolUse-Ausgabeersetzung, Terminal-Scroll- und URL-Fixes sowie mehrere Speicherleckbehebungen hinzu, darunter multi-GB RSS-Wachstum bei vielen Bildern.

OpenClawRadar
NYT Magazin berichtet über den Einsatz von OpenClaw in kleinen Unternehmen — Geschenkartikel geteilt von Reddit
Nachrichten

NYT Magazin berichtet über den Einsatz von OpenClaw in kleinen Unternehmen — Geschenkartikel geteilt von Reddit

Ein Artikel des New York Times Magazine beleuchtet OpenClaw-Anwender, die über ihre Geschäftsanwendungen berichten, ursprünglich gepostet auf r/openclaw. Kostenloser Geschenklink inbegriffen.

OpenClawRadar
Melbourne Psychiater lehnt neue Patienten ab, die KI-Notizen nicht zustimmen
Nachrichten

Melbourne Psychiater lehnt neue Patienten ab, die KI-Notizen nicht zustimmen

Ein Psychiater in Melbourne verlangt von neuen Patienten die Zustimmung zur KI-Transkription von Sitzungen, andernfalls werden sie an andere Anbieter verwiesen – dies wirft Bedenken hinsichtlich Datensicherheit und Genauigkeit auf.

OpenClawRadar