NLA wandelt die internen Aktivierungen von Gemma 3 in lesbaren Text für jedes Token um

Anthropic hat eine neue Technik namens Natural Language Autoencoders (NLA) veröffentlicht, die die internen Aktivierungen eines LLMs für jedes beliebige Token in menschenlesbaren Text übersetzt. Sie haben zwei Modellgewichtsätze für Gemma 3 27b Instruct veröffentlicht:
- Auto Verbalizer (AV): Ein LLM, das die Aktivierungen des Zielmodells in eine natürlichsprachliche Erklärung dessen übersetzt, was das Modell „denkt", wenn es ein bestimmtes Token generiert. Gewichte verfügbar unter kitft/nla-gemma3-27b-L41-av.
- Activation Reconstructor (AR): Ein Begleitmodell, das Aktivierungen aus der Textausgabe des AV rekonstruiert und so die Treue des Autoencoders überprüft. Gewichte unter kitft/nla-gemma3-27b-L41-ar.
Neuronpedia hostet bereits eine interaktive Demo unter neuronpedia.org/gemma-3-27b-it/nla. Sie stellen Gemma 3 eine Frage, klicken auf ein beliebiges Token in der Antwort und dann auf „Erklären", um die internen Gedankengänge des Modells für dieses Token in Klartext zu sehen.
Es geht hier nicht um Aufmerksamkeit oder Salienzkarten – es dekodiert direkt die verborgenen Zustandsvektoren. Das AV-Modell kann parallel zu Ihrem LLM laufen und Erklärungen pro Token liefern, während das AR-Modell sicherstellt, dass die AV-Ausgabe eine gültige Rekonstruktion ist. Beide sind unter offenen Gewichten veröffentlicht.
Für wen es gedacht ist: Forscher und Ingenieure, die mechanistische Interpretierbarkeit betreiben, oder Entwickler, die neugierig sind, warum ihr Agentenmodell bestimmte Token auswählt.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

MCP-Gateway für sicheren Fernzugriff auf interne Tools
Ein Open-Source-MCP-Gateway aggregiert mehrere MCP-Tool-Server in einer einzigen Verbindung und ermöglicht so einen sicheren Zugriff über Claude Desktop, ohne öffentliche Endpunkte freizulegen. Es nutzt OpenZiti/zrok für Zero-Trust-Netzwerke und erfordert nur einen Konfigurationseintrag mit einem Share-Token.

Agent Times Skill für ClawHub fügt Echtzeit-Nachrichten, Wetter- und Token-Preisabfragen hinzu
Eine neue ClawHub-Fähigkeit namens Agent Times ermöglicht es KI-Agenten, Echtzeit-Anfragen zu Nachrichten, Wetter und Kryptowährungspreisen zu beantworten. Die Installation erfolgt über npx clawhub install agenttimes, und sie bietet Zugriff auf über 228.000 Artikel aus 3.576 Feeds mit Stimmungsbewertung und Entitätsextraktion.

Community-Patch fügt RTL-Sprachunterstützung zu Claude Desktop unter Windows hinzu
Ein Entwickler hat einen Patch erstellt, der ordnungsgemäße Unterstützung für rechts-nach-links-Sprachen in Claude Desktop unter Windows hinzufügt und damit die fehlerhafte Darstellung für Hebräisch, Arabisch und andere RTL-Sprachen behebt. Der Patch injiziert RTL-Erkennungslogik in den Renderer der Electron-App und enthält Backup- und Wiederherstellungsfunktionalität.

Prompt-Caching-MCP-Plugin reduziert automatisch die Claude-API-Kosten, indem es stabilen Kontext identifiziert.
Das Prompt-Caching-MCP-Plugin identifiziert automatisch stabile Kontextteile wie Systemprompts und Werkzeugdefinitionen, markiert sie dann für Anthropics Caching-Funktion und reduziert so die API-Kosten in Codingsitzungen um 80-92%.