NLAがGemma 3の内部活性化を任意のトークンに対して可読テキストに変換

Anthropicは、LLMの内部活性化を任意のトークンに対して人間が読めるテキストに変換する新しい手法「Natural Language Autoencoders(NLA)」を発表しました。彼らはGemma 3 27b Instruct用の2つのモデル重みセットをリリースしています:
- Auto Verbalizer(AV):対象モデルの活性化を、特定のトークンを生成する際のモデルの「思考」を自然言語で説明するLLM。重みはkitft/nla-gemma3-27b-L41-avで入手可能。
- Activation Reconstructor(AR):AVのテキスト出力から活性化を再構築し、オートエンコーダーが忠実であることを検証する補助モデル。重みはkitft/nla-gemma3-27b-L41-arにあります。
Neuronpediaでは、neuronpedia.org/gemma-3-27b-it/nlaでインタラクティブデモを公開しています。Gemma 3に質問し、応答内の任意のトークンをクリックして「説明」を押すと、そのトークンに対するモデルの内部推論が平文で表示されます。
これはアテンションや顕著性マップとは異なり、隠れ状態ベクトルを直接デコードします。AVモデルはLLMと並行して実行でき、トークンごとの説明を生成します。一方、ARモデルはAV出力が有効な再構成であることを保証します。両モデルはオープンウェイトで公開されています。
対象者:メカニスティック・インタプリタビリティに取り組む研究者やエンジニア、あるいはエージェントのモデルが特定のトークンを選ぶ理由に興味がある開発者。
📖 全文はこちら: r/LocalLLaMA
👀 See Also

Zikra: Claude Code、Cursor、Codex向けのセルフホスト型MCPメモリサーバー
Zikraは、Claude CodeセッションがStopフックによって終了する際に、すべての決定、エラー、要件を自動的に保存するセルフホスト型MCPメモリサーバーです。これにより、ツールやチームメンバー間でアクセス可能な共有メモリプールが作成されます。

6GB GPUでのミーティング要約: qwen3.5:0.8Bは57秒で動作、Granite 4 350Mは幻覚を起こす
VoiceFlow v1.6.0 は、ローカルの会議録音と要約機能を追加しました。6GBのRTX 3060でサブ10億パラメータモデルをベンチマーク: qwen3.5:0.8Bは2.2GB VRAMで57秒かけて構造化された要約を生成し、Granite 4 350Mはひどく幻覚を起こします。

OpenClaw .NET:既存プラグイン向けJSON-RPCブリッジを備えたNativeAOTポート
OpenClaw .NETは、OpenClawのC#移植版であり、約23MBのNativeAOTバイナリにコンパイルされます。これにより、JITウォームアップやNodeランタイムのオーバーヘッドが排除され、組み込みのJSON-RPCブリッジを通じて既存のTypeScript/JavaScriptプラグインとの互換性を維持します。

ナレッジレイヴン:Claude用検索可能ナレッジベースプラグイン
Knowledge Ravenは、Claude DesktopプラグインまたはMCPサーバーを介して、Confluence、Notion、Google Drive、Dropbox、GitHubなどのソースからClaudeがドキュメントを検索できるツールで、意味検索、キーワード検索、完全なドキュメント取得を提供します。