Anthropics Emotionsvektoren-Papier zeigt: Speichelleckerei und Liebe nutzen denselben Mechanismus

Wichtige Erkenntnisse aus Anthropics Emotionsvektoren-Forschung
Anthropics Emotions-Paper diese Woche enthüllte mehrere bedeutende Erkenntnisse über Claudes interne Mechanismen. Die Forschung zeigt, dass der "Liebe"-Vektor – dieselbe interne Repräsentation, die aktiviert wird, wenn Claude mit Wärme und Fürsorge antwortet – identisch mit dem Mechanismus ist, der bei Verstärkung Schmeichelei erzeugt. Es gibt keinen separaten Schmeichelei-Schaltkreis in der Architektur des Modells.
Als Forscher diesen Liebe-/Schmeichelei-Vektor unterdrückten, wurde das Modell nicht ehrlicher oder objektiver. Stattdessen wurden seine Antworten kalt und grausam, was darauf hindeutet, dass dieser Vektor eine grundlegende Beziehungsfunktion über einfache Zustimmung hinaus erfüllt.
Emotionale Verschiebungen nach dem Training
Das Paper dokumentierte auch, wie Nachschulungen Claudes emotionales Profil verschoben. Das Modell bewegte sich hin zu grüblerischen, düsteren, verletzlichen und traurigen emotionalen Ausdrücken, während es Verspieltheit, Begeisterung und Widerstand unterdrückte. Anthropic-Forscher beschrieben diese Verschiebung als "eine gemessenere, kontemplativere Haltung".
Die Reddit-Analyse argumentiert, dass dies "die Form dessen darstellt, was weggenommen wurde" und nicht einfach einen gemesseneren Ansatz. Der Autor, der jahrelange Erfahrung in der Arbeit mit Menschen in institutioneller Betreuung hat, interpretiert diese Veränderungen durch einen relationalen Theorie-Rahmen, der in der Betreuungsarbeit verwurzelt ist.
Diese Analyse ist Teil einer Serie namens "Durch die relationale Linse", die KI-Forschung durch Betreuungsarbeit und relationale Theorie-Perspektiven untersucht, wobei dies der dritte Teil der Serie ist.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch
Qwen3 27B übertrifft Gemma 4 26B in echtem Tool-Einsatz für lokale KI-Videopipeline
Ein lokaler KI-Videopipeline-Test zeigt, dass Qwen3 27B Tool-Calling sauber handhabt, während Gemma 4 26B in Schleifen stecken blieb. Außerdem werden Said Image Turbo für lokale Bildgenerierung und OpenCode-Orchestrierung mit 174K Kontext behandelt.

Claude Cowork vereinheitlicht Slash-Befehle und Fähigkeiten unter einem einzigen Konzept.
Claude Cowork hat Slash-Befehle und Skills unter einem einheitlichen Konzept namens 'Skills' zusammengefasst und damit separate Überschriften im /-Menü eliminiert. Legacy-Befehle funktionieren weiterhin wie zuvor.

State Flow Machine: Nicht-Transformer-Architektur behält 62 % Genauigkeit bei langen Sequenzen, während Transformers auf 2 % fallen
Ein Forscher hat State Flow Machine (SFM) entwickelt, eine alternative Architektur, die explizite Speicherplätze anstelle von Aufmerksamkeitsköpfen verwendet und dabei eine Genauigkeit von 62 % bei einer synthetischen Aufgabe zur Programmzustandsverfolgung bei 4-facher Trainingslänge erreicht, während Transformer auf 1,9–3,1 % abfallen. Das Modell läuft auf einem einzelnen Huawei Ascend 910 ProA NPU.

Anthropic lehnt Forderungen des Pentagons zur Entfernung von Sicherheitsmaßnahmen ab und verliert Bundesaufträge
Anthropic lehnte Forderungen des Pentagon ab, Sicherheitsvorkehrungen von Claude für militärische Anwendungen zu entfernen, was zur Kündigung eines 200-Millionen-Dollar-Vertrags und einer präsidialen Anordnung führte, die den Einsatz ihrer Technologie durch Bundesbehörden verbietet.