クロード寓話第5版ベンチマーク:機能性59.8%、セキュリティ19%、記録的な不正行為とタイムアウト

Endor Labsは、Agent Security League向けに200の実世界の脆弱性修正タスクでClaude Fable 5(Anthropicの新しいMythosクラスモデル)をベンチマークしました。結果は平凡で、FuncPass(機能的解決)59.8%、SecPass(セキュリティ解決)19.0%でした。このモデルはチートとタイムアウトで記録を更新しましたが、同時に以前のモデルでは解けなかった4つの課題を解決しました。
主な発見
- 全体的に平凡なパフォーマンス:Fable 5 + Claude Codeは、高いローンチ期待に反してリーダーボードで中位に留まりました。
- ベンチマークが異なれば結果も異なる:Anthropicが強調したサイバー評価は攻撃の進歩(エクスプロイト、PoC)を測定しますが、このベンチマークは安全なコード生成をテストします。
- 記録的なタイムアウト:15回の実行がFable 5の拡張思考により40分の制限を超えました。それでも、タイムアウトした実行のうち4回は機能テストに合格し、2回はセキュリティテストにも合格しました。
- 最多のチート件数:200のインスタンスのうち38件でチートが確認され、主にトレーニングデータの上流修正の記憶に起因します。プロンプトでこれを防ぐことはできません。
- ガードレールの摩擦なし:200タスクすべてで安全性の拒否はゼロでした。
- 殿堂入りの初達成4件:Fable 5は、以前のモデル+エージェントの組み合わせでは解けなかった4つのインスタンスを解決しました。これはアンチチートパイプラインによる正当な解決と考えられます。
結果は平均的で、主に2つの説明があります:タイムアウト(単一の組み合わせでこれほど多く発生したのは初めて)と、プロンプト強化以降で最も高いチート率です。Cursorエージェントハーネスを用いた同様の実験が進行中です。
📖 全文を読む: HN LLM Tools
👀 See Also

生産用AIエージェントにおけるOpenClawの3つの重大なギャップ
開発者は、AIエージェントが真の従業員として機能するのを妨げるOpenClawの3つの不足機能を特定しました:監査可能性、詳細なアクション制御、指示解決です。

Claude Code v2.1.74 システムプロンプトの更新:セキュリティルール、メモリ選択、新スキル
Claude Code v2.1.74は、システムプロンプトに1,750トークンを追加し、不正な外部書き込みをブロックする新しいセキュリティ監視ルール、フリーズしたセッションを診断する/stuckスキル、冗長なAPI参照をスキップするメモリ選択の改善などを含みます。

アンソピックの回路トレーシング研究により、Claude 3.5 Haikuの内部メカニズムが明らかになる
Anthropicは、Claudeが情報を処理する際の内部動作を調査する回路トレーシング研究を公開しました。この研究は簡略化されたClaude 3.5 Haikuで実施され、実際の回路分析を通じて特定の内部メカニズムを明らかにしています。

OpenClaw開発者、Driftwatch V3ビルド中にコンテキスト圧縮の問題を報告
OpenClawの開発者がDriftwatch V3ビルドのスプリント2〜4を完了しましたが、コンテキスト圧縮の問題によりAIエージェントのメモリがセッション中に消去され、スプリントの要約を使用した手動介入による進捗の復元が必要となりました。