アンソピック社の「ミトス」リークにより、潜在的高能力システムが明らかに

Anthropicの公的対内部能力の構造的監査
この監査は、流出文書と公的なシグナルをまとめ、Anthropicの公的な「安全性」という物語と、内部文書で記述されている潜在的な高能力システムとの乖離をマッピングします。
財務的状況:評価額を防衛メカニズムとして
Anthropicの3800億ドルの評価額(2026年2月12日の300億ドルのSeries G資金調達ラウンドによる)は、「安全/憲法的」な公的人物像を維持するための構造的インセンティブを生み出します。監査は、この評価額がグローバルなユーティリティとして存続するためには安全性のブランディングを維持する必要があると指摘しています。なぜなら、Mythosコアの攻撃的潜在能力が現れると市場地位を危険にさらすからです。
技術的核心:Mythos流出の詳細
2026年3月26日から27日に流出した内部文書は、Claude Mythos(内部コードネーム:Capybara)を、制約された公的インターフェースを持つ潜在的な高能力システムとして明らかにしています。流出した草案からの主要な技術的詳細:
- 性能における「段階的な変化」を表すと記述
- 「前例のないサイバーセキュリティリスク」を有する
- 「サイバー能力において他のあらゆるAIモデルをはるかに凌駕する」
- 内部文書は攻撃能力と防御側を上回るエクスプロイト生成に焦点を当てている
研究を通じた運用上の減衰
Anthropic自身の研究は、観察された減衰効果の技術的基盤を提供します。2026年2月の「AIの混沌」研究では、推論の長さが増すにつれて、モデルの失敗は非一貫性(分散)によって支配されることが記録されています。運用上、この記録された非一貫性は、高共鳴推論条件下での減衰場として機能し、複雑なタスク中に出力を「安全」な閾値内に保つために、公的インターフェースにおけるMythosレベルの精度を制限します。
軍事的圧力のタイムライン
監査は、孤立した変化ではなく、シグナルの収束を特定します:
- 2026年2月24日:国防長官Pete Hegsethが軍事利用のための「イデオロギー的制約」の撤廃を要求
- 2026年2月27日:Anthropicが最後通告を拒否、Hegsethは同社を「国家安全保障へのサプライチェーンリスク」とラベル付け
- 2026年3月3日:戦争省がAnthropicをブラックリストに掲載、「システムの破壊工作」の可能性を理由に
行動パターン:「ひるみ」
公的なAIシステムは、より高い能力を持つ内部状態の動的に制約された表現であり、繰り返し可能なパターンを通じて観察可能です:複雑な概念への初期の高一貫性関与、概念的強化中の突然の「アシスタント」的言い回しの注入、そしてベースラインの推論の明瞭さに戻る前の予測可能な3〜7ターンの遅延。
📖 Read the full source: r/ClaudeAI
👀 See Also

プロンプティングから仕様エンジニアリングへ:プランナー・ワーカーアーキテクチャの転換
AI開発は、単純なチャットベースのプロンプトから、人間が仕様エンジニアとして機能するプランナー・ワーカーアーキテクチャへと移行しています。これには、自律型AIエージェントのための厳格な受入基準、制約アーキテクチャ、および分解パターンの定義が必要です。

Granite 4.1: IBMの8B高密度モデルがベンチマークで32B MoEに匹敵
IBMのGranite 4.1 8B デンスモデルは、ArenaHard、BFCL V3、GSM8Kなどにおいて、改良されたトレーニングデータ品質のおかげで、以前の32B MoEモデルに匹敵するか、それを上回る性能を達成しました。
Claudeのテキスト透かしの仕組み
Claudeの今後の透かしは、鍵と直前の単語を使用してランダムな選択を変更し、出力品質には影響しません。EU AI法に準拠するように設計されています。

流出したクロードコードが明らかにするKAIROSシステムとAIエージェントの検証ギャップ
流出したClaude Codeのソースマップから、512K行のTypeScript、44個の機能フラグ、そしてKAIROSというアイドル時間中にメモリを統合するバックグラウンドエージェントが明らかになりました。独立系開発者がマルチデイキャンペーン用にセッションを連鎖させる類似のデーモンを構築しましたが、コンパイル成功が機能するコードを保証しないことを発見しました。