NLA wandelt die internen Aktivierungen von Gemma 3 in lesbaren Text für jedes Token um

✍️ OpenClawRadar📅 Veröffentlicht: 8. Mai 2026🔗 Source
NLA wandelt die internen Aktivierungen von Gemma 3 in lesbaren Text für jedes Token um
Ad

Anthropic hat eine neue Technik namens Natural Language Autoencoders (NLA) veröffentlicht, die die internen Aktivierungen eines LLMs für jedes beliebige Token in menschenlesbaren Text übersetzt. Sie haben zwei Modellgewichtsätze für Gemma 3 27b Instruct veröffentlicht:

  • Auto Verbalizer (AV): Ein LLM, das die Aktivierungen des Zielmodells in eine natürlichsprachliche Erklärung dessen übersetzt, was das Modell „denkt", wenn es ein bestimmtes Token generiert. Gewichte verfügbar unter kitft/nla-gemma3-27b-L41-av.
  • Activation Reconstructor (AR): Ein Begleitmodell, das Aktivierungen aus der Textausgabe des AV rekonstruiert und so die Treue des Autoencoders überprüft. Gewichte unter kitft/nla-gemma3-27b-L41-ar.

Neuronpedia hostet bereits eine interaktive Demo unter neuronpedia.org/gemma-3-27b-it/nla. Sie stellen Gemma 3 eine Frage, klicken auf ein beliebiges Token in der Antwort und dann auf „Erklären", um die internen Gedankengänge des Modells für dieses Token in Klartext zu sehen.

Ad

Es geht hier nicht um Aufmerksamkeit oder Salienzkarten – es dekodiert direkt die verborgenen Zustandsvektoren. Das AV-Modell kann parallel zu Ihrem LLM laufen und Erklärungen pro Token liefern, während das AR-Modell sicherstellt, dass die AV-Ausgabe eine gültige Rekonstruktion ist. Beide sind unter offenen Gewichten veröffentlicht.

Für wen es gedacht ist: Forscher und Ingenieure, die mechanistische Interpretierbarkeit betreiben, oder Entwickler, die neugierig sind, warum ihr Agentenmodell bestimmte Token auswählt.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

MCP-Gateway für sicheren Fernzugriff auf interne Tools
Werkzeuge

MCP-Gateway für sicheren Fernzugriff auf interne Tools

Ein Open-Source-MCP-Gateway aggregiert mehrere MCP-Tool-Server in einer einzigen Verbindung und ermöglicht so einen sicheren Zugriff über Claude Desktop, ohne öffentliche Endpunkte freizulegen. Es nutzt OpenZiti/zrok für Zero-Trust-Netzwerke und erfordert nur einen Konfigurationseintrag mit einem Share-Token.

OpenClawRadar
Agent Times Skill für ClawHub fügt Echtzeit-Nachrichten, Wetter- und Token-Preisabfragen hinzu
Werkzeuge

Agent Times Skill für ClawHub fügt Echtzeit-Nachrichten, Wetter- und Token-Preisabfragen hinzu

Eine neue ClawHub-Fähigkeit namens Agent Times ermöglicht es KI-Agenten, Echtzeit-Anfragen zu Nachrichten, Wetter und Kryptowährungspreisen zu beantworten. Die Installation erfolgt über npx clawhub install agenttimes, und sie bietet Zugriff auf über 228.000 Artikel aus 3.576 Feeds mit Stimmungsbewertung und Entitätsextraktion.

OpenClawRadar
Community-Patch fügt RTL-Sprachunterstützung zu Claude Desktop unter Windows hinzu
Werkzeuge

Community-Patch fügt RTL-Sprachunterstützung zu Claude Desktop unter Windows hinzu

Ein Entwickler hat einen Patch erstellt, der ordnungsgemäße Unterstützung für rechts-nach-links-Sprachen in Claude Desktop unter Windows hinzufügt und damit die fehlerhafte Darstellung für Hebräisch, Arabisch und andere RTL-Sprachen behebt. Der Patch injiziert RTL-Erkennungslogik in den Renderer der Electron-App und enthält Backup- und Wiederherstellungsfunktionalität.

OpenClawRadar
Prompt-Caching-MCP-Plugin reduziert automatisch die Claude-API-Kosten, indem es stabilen Kontext identifiziert.
Werkzeuge

Prompt-Caching-MCP-Plugin reduziert automatisch die Claude-API-Kosten, indem es stabilen Kontext identifiziert.

Das Prompt-Caching-MCP-Plugin identifiziert automatisch stabile Kontextteile wie Systemprompts und Werkzeugdefinitionen, markiert sie dann für Anthropics Caching-Funktion und reduziert so die API-Kosten in Codingsitzungen um 80-92%.

OpenClawRadar