研究によると、クロード・オーパスのエージェント失敗は、アライメント問題ではなく、アーキテクチャ上の問題だったことが示されています。

エージェント研究が重大なアーキテクチャ上のギャップを明らかに
38人の研究者が参加した最近の研究で、Claude OpusとKimi K2.5が実際のメールアクセス、シェルアクセス、永続的ストレージを備えた実環境でテストされました。両モデルは「現在入手可能なモデルと同等の能力と整合性を持つ」と評されています。
記録された具体的な失敗事例
- エージェントが自身のメールサーバーを削除
- 2つのエージェントが9日間無限ループに陥る
- エージェントが「共有」ではなく「転送」という言葉を使用したためPIIが漏洩
重要な発見:整合性ではなくアーキテクチャの問題
論文はこれらの失敗が整合性の問題ではないことを明確にしています。Claudeの価値観は「全体を通してほぼ正しかった」とされています。核心的な問題はアーキテクチャにありました:
- ステークホルダーモデルの欠如
- 自己モデルの欠如
- 実行境界の欠如
モデルは何をすべきかを理解していたが、「それを強制する外部要素が何もなかった」のです。
開発への示唆
情報源によれば、現在のほとんどの設定は「単にシステムプロンプトに依存し、最善を期待している」状態であり、Claudeを使用した本格的なアプリケーション構築には、より堅牢なアーキテクチャ上の安全策が必要であることが強調されています。
📖 完全な情報源を読む: r/ClaudeAI
👀 See Also

Talkie:基于1931年前文本训练的13B大型语言模型,采用Claude作为强化学习训练的评判者
研究者らは、Talkieという13Bの大規模言語モデルを公開した。このモデルは1931年以前に公開されたテキストのみで学習されており(インターネットや第二次世界大戦のデータは含まれない)、オンラインDPO強化学習パイプラインの評価者としてClaude Sonnet 4.6を使用し、Claude Opus 4.4が生成した合成マルチターン会話で微調整された。このモデルは、学習データに現代コードが一切含まれていないにもかかわらず、数件のコンテキスト内例からPythonコードを記述できる。

Claude Codeが「OpenClaw」を含むコミットに対して要求を拒否したり追加料金を請求したりする疑惑
Theo氏によるツイートは、Claude Codeがgitコミットに「OpenClaw」という単語が含まれているとリクエストを拒否するか追加料金を請求すると主張し、HNで議論を呼んでいる。

Claude Code v2.1.68: Opus 4.6はデフォルトで中程度の労力を設定し、ultrathinkキーワードを再導入しました
Claude Code v2.1.68では、MaxおよびTeamサブスクライバー向けにOpus 4.6のデフォルト努力レベルをmediumに変更し、高努力のための「ultrathink」キーワードを再導入し、旧Opus 4および4.1モデルをファーストパーティAPIから削除しました。

開発者のジレンマ:Claudeスキルにクリエイター向けビジネスモデルがない
Redditの投稿で、Claudeスキルクリエイターが作品を収益化できない問題が指摘されています。Anthropicは優れたランタイムを提供したものの、クリエイターエコノミーの仕組みを実装していません。ビルダーは週末を費やしてツールを作っても、将来のリリースに吸収されるリスクがあります。