NLA wandelt die internen Aktivierungen von Gemma 3 in lesbaren Text für jedes Token um

Anthropic hat eine neue Technik namens Natural Language Autoencoders (NLA) veröffentlicht, die die internen Aktivierungen eines LLMs für jedes beliebige Token in menschenlesbaren Text übersetzt. Sie haben zwei Modellgewichtsätze für Gemma 3 27b Instruct veröffentlicht:
- Auto Verbalizer (AV): Ein LLM, das die Aktivierungen des Zielmodells in eine natürlichsprachliche Erklärung dessen übersetzt, was das Modell „denkt", wenn es ein bestimmtes Token generiert. Gewichte verfügbar unter kitft/nla-gemma3-27b-L41-av.
- Activation Reconstructor (AR): Ein Begleitmodell, das Aktivierungen aus der Textausgabe des AV rekonstruiert und so die Treue des Autoencoders überprüft. Gewichte unter kitft/nla-gemma3-27b-L41-ar.
Neuronpedia hostet bereits eine interaktive Demo unter neuronpedia.org/gemma-3-27b-it/nla. Sie stellen Gemma 3 eine Frage, klicken auf ein beliebiges Token in der Antwort und dann auf „Erklären", um die internen Gedankengänge des Modells für dieses Token in Klartext zu sehen.
Es geht hier nicht um Aufmerksamkeit oder Salienzkarten – es dekodiert direkt die verborgenen Zustandsvektoren. Das AV-Modell kann parallel zu Ihrem LLM laufen und Erklärungen pro Token liefern, während das AR-Modell sicherstellt, dass die AV-Ausgabe eine gültige Rekonstruktion ist. Beide sind unter offenen Gewichten veröffentlicht.
Für wen es gedacht ist: Forscher und Ingenieure, die mechanistische Interpretierbarkeit betreiben, oder Entwickler, die neugierig sind, warum ihr Agentenmodell bestimmte Token auswählt.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Die Dual-Modell-Architektur reduziert den Token-Verbrauch für lange Gespräche um die Hälfte.
Ein Entwickler hat ein Dual-Modell-System aufgebaut, bei dem ein kleines 'Unterbewusstseins'-Modell im Hintergrund den Gesprächsverlauf komprimiert. Dadurch kann das Hauptmodell mit einem kuratierten Kontext von etwa 35K Token arbeiten, anstatt mit 120K Token des rohen Verlaufs. Diese Architektur reduziert den Token-Verbrauch bei längerfristigen Projektarbeiten ungefähr um die Hälfte.

Telegram-Bot zur CLI-Steuerung von Claude Code vom Mobilgerät aus
Ein Entwickler hat einen Telegram-Bot erstellt, der eine Brücke zur Claude Code CLI schlägt und die Steuerung über mobile Befehle wie /commit, /code_review und /simplify ermöglicht. Der Bot entdeckt automatisch benutzerdefinierte Fähigkeiten, verarbeitet Fotos/Dokumente/Sprachnachrichten und unterstützt Gruppenchat-Sitzungen.
Voker launcht Agent Analytics Plattform mit Intent/Korrektur/Resolution-Prüfmitteln
Das YC S24 Startup Voker bringt eine Analyseplattform für KI-Agenten auf den Markt, die mit einem leichten SDK automatisch Benutzerabsichten, Korrekturen und Lösungen annotiert – und dabei Self-Service-Dashboards bietet, ohne für Data Engineering auf LLMs angewiesen zu sein.

Claude Code-Fähigkeit erstellt App Store-Screenshots mit Gemini AI
Eine neue Claude Code-Fähigkeit namens /aso-cosmicmeta-ss erstellt App Store- und Google Play-Screenshots über einen 6-Phasen-Workflow, der Codebasen analysiert und Gemini AI zur Verbesserung nutzt. Die Fähigkeit enthält eine Freigabestufe, um Layoutprobleme zu erkennen, bevor API-Guthaben verwendet werden.