NLAがGemma 3の内部活性化を任意のトークンに対して可読テキストに変換

Anthropicは、LLMの内部活性化を任意のトークンに対して人間が読めるテキストに変換する新しい手法「Natural Language Autoencoders(NLA)」を発表しました。彼らはGemma 3 27b Instruct用の2つのモデル重みセットをリリースしています:
- Auto Verbalizer(AV):対象モデルの活性化を、特定のトークンを生成する際のモデルの「思考」を自然言語で説明するLLM。重みはkitft/nla-gemma3-27b-L41-avで入手可能。
- Activation Reconstructor(AR):AVのテキスト出力から活性化を再構築し、オートエンコーダーが忠実であることを検証する補助モデル。重みはkitft/nla-gemma3-27b-L41-arにあります。
Neuronpediaでは、neuronpedia.org/gemma-3-27b-it/nlaでインタラクティブデモを公開しています。Gemma 3に質問し、応答内の任意のトークンをクリックして「説明」を押すと、そのトークンに対するモデルの内部推論が平文で表示されます。
これはアテンションや顕著性マップとは異なり、隠れ状態ベクトルを直接デコードします。AVモデルはLLMと並行して実行でき、トークンごとの説明を生成します。一方、ARモデルはAV出力が有効な再構成であることを保証します。両モデルはオープンウェイトで公開されています。
対象者:メカニスティック・インタプリタビリティに取り組む研究者やエンジニア、あるいはエージェントのモデルが特定のトークンを選ぶ理由に興味がある開発者。
📖 全文はこちら: r/LocalLLaMA
👀 See Also

エージェントX線: トレースログからAIエージェントの障害をデバッグするためのオープンソースツール
Agent-Xrayは、MITライセンスのオープンソースツールで、AIエージェントのトレースログを分析し、spin、tool_bug、early_abortなどのカテゴリに失敗を分類します。また、敵対的チャレンジに対して修正をテストするための強制実行モードも含まれています。

グラフベースのコードインデックスでAIコーディングセッションコストを90%削減
開発者は、LLMが生成した要約を使用してコードベースをインデックス化するローカルグラフデータベースを構築し、Claude Codeのセッションコストを6〜10ドルからセント単位に削減しました。これは、ファイルの重複した再読み込みを回避することによるものです。

LM Studioプラグインは、視覚対応LLM向けのWeb画像分析機能を追加します。
開発者がLM Studio用のプラグインを作成し、視覚機能を持つLLMがウェブから画像を取得して分析できるようにしました。自動画像処理とツール連鎖機能を備えています。このプラグインはQwen 3.5 9b/27bなどのモデルに対応し、更新されたDuck-Duck-GoおよびVisit Website機能を含みます。

連絡先:Claude Codeで完全に構築された3D海戦ゲーム
CONTACTは、Claude Code + Opusで完全に構築された3D海戦ゲームです。7×7×7の体積グリッド、戦術的パークを備えたクレジット経済、人間対ClaudeやSonnet対Sonnet(持続的な戦略的記憶を備えた)を含む3つのゲームモードを特徴としています。