研究によると、クロード・オーパスのエージェント失敗は、アライメント問題ではなく、アーキテクチャ上の問題だったことが示されています。

エージェント研究が重大なアーキテクチャ上のギャップを明らかに
38人の研究者が参加した最近の研究で、Claude OpusとKimi K2.5が実際のメールアクセス、シェルアクセス、永続的ストレージを備えた実環境でテストされました。両モデルは「現在入手可能なモデルと同等の能力と整合性を持つ」と評されています。
記録された具体的な失敗事例
- エージェントが自身のメールサーバーを削除
- 2つのエージェントが9日間無限ループに陥る
- エージェントが「共有」ではなく「転送」という言葉を使用したためPIIが漏洩
重要な発見:整合性ではなくアーキテクチャの問題
論文はこれらの失敗が整合性の問題ではないことを明確にしています。Claudeの価値観は「全体を通してほぼ正しかった」とされています。核心的な問題はアーキテクチャにありました:
- ステークホルダーモデルの欠如
- 自己モデルの欠如
- 実行境界の欠如
モデルは何をすべきかを理解していたが、「それを強制する外部要素が何もなかった」のです。
開発への示唆
情報源によれば、現在のほとんどの設定は「単にシステムプロンプトに依存し、最善を期待している」状態であり、Claudeを使用した本格的なアプリケーション構築には、より堅牢なアーキテクチャ上の安全策が必要であることが強調されています。
📖 完全な情報源を読む: r/ClaudeAI
👀 See Also

SubQ: 完全な準二次LLM、1200万トークンのコンテキストと95%のRULER精度を達成
SubquadraticがSubQ 1M-Previewを発表。線形計算スケーリング、1200万トークンコンテキスト、FlashAttention比52倍高速なスパース注意機構、RULER 128Kで95%を達成。API、CLIコードエージェント(SubQ Code)、検索ツール(SubQ Search)で利用可能。
数学におけるAIのミスアラインメント:Tao、エコノミスト、そして622件のコメントが寄せられたHNの議論
テリー・タオと『エコノミスト』が2026年9月11日、数学におけるAIのミスアラインメントについての記事を同時に公開。Hacker Newsのスレッドは560ポイント、622コメントに達した。

最高裁判所が審理を拒否、AI生成アートは著作権保護対象外のまま
米国最高裁判所は、AIが生成したアートの著作権に関する訴訟の審理を拒否し、著作権保護には『人間の著作物性』が必要とする下級裁判所の判決を維持しました。これは、2022年に著作権局がスティーブン・セイラー氏のアルゴリズムが作成した画像の著作権登録申請を拒否したことに続くものです。

Claude Code v2.1.89では、遅延可能なフック、権限リトライ機能が追加され、メモリリークの問題が修正されました。
Claude Code v2.1.89では、PreToolUseフックに「defer」権限決定を導入し、再試行機能を備えたPermissionDeniedフックを追加、さらに大規模JSON入力でのメモリリークやStructuredOutputスキーマキャッシュの失敗など重大な問題を修正しました。