ステアリング-8B:トークンレベルの帰属付けを備えた解釈可能な言語モデル

モデルアーキテクチャと機能
Steerling-8Bは、次トークンレベルだけでなく、マルチトークンシーケンス全体で生成を制御できる因果的離散拡散モデルバックボーン上に構築されています。主要な設計は、モデルの埋め込みを3つの明示的な経路に分解します:約33,000の教師あり「既知」概念、約100,000のモデルが独自に学習する「発見」概念、および残りの情報を捕捉する残差コンポーネントです。
モデルは、基本的なパフォーマンスのトレードオフなしに概念を通じた信号ルーティングを保証するトレーニング損失関数を使用します。概念は線形経路を通じてロジットに入力され、すべての予測が正確に概念ごとの寄与に分解できます。これらの寄与は、再トレーニングなしで推論時に編集可能です。
パフォーマンスと解釈可能性の指標
同等のモデルよりも大幅に少ない計算量でトレーニングされているにもかかわらず、Steerling-8Bは標準的なベンチマークで競争力のあるパフォーマンスを達成しています。このモデルは、使用FLOPsが少ないにもかかわらず、全体平均でLLaMA2-7BとDeepseek-7Bの両方を上回り、2〜10倍の計算量でトレーニングされたモデルの範囲内に留まっています。
ホールドアウト検証セットでは、トークンレベルの寄与の84%以上が概念モジュールから来ており、モデルが予測を行うために残差だけを使用していないことを示しています。残差経路を除去した場合、いくつかのLM Harnessタスクでのパフォーマンスはわずかな影響しか示さず、モデルの予測信号が主に隠れたチャネルではなく概念を通じてルーティングされていることを示唆しています。
Steerlingは、テキスト内の既知概念を96.2%のAU(曲線下面積)で検出できます。
実用的な機能
Steerlingが生成する出力トークンのグループについて、ユーザーはこれらのトークンを以下にトレースできます:
- 入力コンテキスト:出力に影響を与えた特定のプロンプトトークン
- 概念:モデルの表現における人間が理解可能なトピック(「分析的、臨床的」などのトーンや「遺伝子改変方法論」などのコンテンツ)
- トレーニングデータ:出力を駆動したトレーニングデータソース(ArXiv、Wikipedia、FLANなどのソース間での分布を示す)
モデルは、概念制御による推論時のアライメントを可能にし、数千の安全性トレーニング例を明示的な概念レベルの制御に置き換えます。また、再トレーニングなしで推論時に特定の概念を抑制または増幅することも可能です。
利用可能な成果物
- Hugging Faceで利用可能なモデル重み
- GitHub上のコンパニオンコード
- PyPI上のパッケージ
📖 完全なソースを読む: HN AI Agents
👀 See Also

SpecLock: AIコーディングエージェント向けオープンソース制約エンジン
SpecLockは、Claude CodeなどのAIコーディングエージェントに対して制約を積極的に適用するMCPサーバーです。同義語の拡張、否定検出、破壊的アクションのフラグ付けを使用して、意味的な競合警告で違反をブロックします。

M3 ProでClaude Codeをオフライン実行:Qwen3.6で動作した4つの修正点
4つの環境変数の修正により、Claude CodeがApple M3 Pro上でQwen3.6(MoE、約3Bアクティブ)を使用して完全オフラインで動作し、データがマシン外に出ることなくSREインシデント対応ループを調査からPRまで完遂。

Tokenmeter: オフラインでClaude Codeのトークン使用量を追跡する無料Windowsアプリ
Tokenmeterは、ローカルのClaude Code .jsonlファイルを読み取り、トークン使用量、推定コスト、キャッシュ節約量、90日間のアクティビティヒートマップをすべてオフラインで表示する、無料のオープンソースWindowsアプリです。

開発者がAIを活用して4日間でWASM用Schemeコンパイラを構築
開発者のマシュー・フィリップスは、AIの支援を活用して約4日間でWebAssemblyをターゲットとするSchemeコンパイラ「Puppy Scheme」を作成しました。このコンパイラはR5RSとR7RSの73%をサポートし、WASM GCを使用しており、一晩でコンパイル時間を3分半から11秒に改善しました。