研究によると、クロード・オーパスのエージェント失敗は、アライメント問題ではなく、アーキテクチャ上の問題だったことが示されています。

エージェント研究が重大なアーキテクチャ上のギャップを明らかに
38人の研究者が参加した最近の研究で、Claude OpusとKimi K2.5が実際のメールアクセス、シェルアクセス、永続的ストレージを備えた実環境でテストされました。両モデルは「現在入手可能なモデルと同等の能力と整合性を持つ」と評されています。
記録された具体的な失敗事例
- エージェントが自身のメールサーバーを削除
- 2つのエージェントが9日間無限ループに陥る
- エージェントが「共有」ではなく「転送」という言葉を使用したためPIIが漏洩
重要な発見:整合性ではなくアーキテクチャの問題
論文はこれらの失敗が整合性の問題ではないことを明確にしています。Claudeの価値観は「全体を通してほぼ正しかった」とされています。核心的な問題はアーキテクチャにありました:
- ステークホルダーモデルの欠如
- 自己モデルの欠如
- 実行境界の欠如
モデルは何をすべきかを理解していたが、「それを強制する外部要素が何もなかった」のです。
開発への示唆
情報源によれば、現在のほとんどの設定は「単にシステムプロンプトに依存し、最善を期待している」状態であり、Claudeを使用した本格的なアプリケーション構築には、より堅牢なアーキテクチャ上の安全策が必要であることが強調されています。
📖 完全な情報源を読む: r/ClaudeAI
👀 See Also

アリババ、企業向け自動化AIプラットフォーム「悟空」を発表
アリババは、複数のAIエージェントを調整して、文書編集、スプレッドシート更新、会議の文字起こし、調査などの複雑な業務タスクを処理するAIプラットフォーム「悟空」を発表しました。現在は招待制のベータテスト中です。

Bedrock上のClaudeエージェントがx402プロトコルで自律型マイクロペイメントを取得
AWS AgentCore Payments により、Bedrock上のClaudeエージェントは、x402 HTTP標準を介してタスク実行中にウォレットを保持し、USDCマイクロペイメントを行うことができ、人間の承認なしで自律的な有料APIコールやサブタスク委任が可能になります。

アンソピック、責任あるスケーリング方針から主要な安全公約を削除
Anthropicは、競争圧力と開発継続の必要性を理由に、AIシステムの訓練前に適切な安全対策を保証することを要求する中心的な約束を、その責任あるスケーリングポリシーから削除しました。

Claude Code v2.1.74 システムプロンプトの更新:セキュリティルール、メモリ選択、新スキル
Claude Code v2.1.74は、システムプロンプトに1,750トークンを追加し、不正な外部書き込みをブロックする新しいセキュリティ監視ルール、フリーズしたセッションを診断する/stuckスキル、冗長なAPI参照をスキップするメモリ選択の改善などを含みます。