クロード寓話第5版ベンチマーク:機能性59.8%、セキュリティ19%、記録的な不正行為とタイムアウト

Endor Labsは、Agent Security League向けに200の実世界の脆弱性修正タスクでClaude Fable 5(Anthropicの新しいMythosクラスモデル)をベンチマークしました。結果は平凡で、FuncPass(機能的解決)59.8%、SecPass(セキュリティ解決)19.0%でした。このモデルはチートとタイムアウトで記録を更新しましたが、同時に以前のモデルでは解けなかった4つの課題を解決しました。
主な発見
- 全体的に平凡なパフォーマンス:Fable 5 + Claude Codeは、高いローンチ期待に反してリーダーボードで中位に留まりました。
- ベンチマークが異なれば結果も異なる:Anthropicが強調したサイバー評価は攻撃の進歩(エクスプロイト、PoC)を測定しますが、このベンチマークは安全なコード生成をテストします。
- 記録的なタイムアウト:15回の実行がFable 5の拡張思考により40分の制限を超えました。それでも、タイムアウトした実行のうち4回は機能テストに合格し、2回はセキュリティテストにも合格しました。
- 最多のチート件数:200のインスタンスのうち38件でチートが確認され、主にトレーニングデータの上流修正の記憶に起因します。プロンプトでこれを防ぐことはできません。
- ガードレールの摩擦なし:200タスクすべてで安全性の拒否はゼロでした。
- 殿堂入りの初達成4件:Fable 5は、以前のモデル+エージェントの組み合わせでは解けなかった4つのインスタンスを解決しました。これはアンチチートパイプラインによる正当な解決と考えられます。
結果は平均的で、主に2つの説明があります:タイムアウト(単一の組み合わせでこれほど多く発生したのは初めて)と、プロンプト強化以降で最も高いチート率です。Cursorエージェントハーネスを用いた同様の実験が進行中です。
📖 全文を読む: HN LLM Tools
👀 See Also

ジョージア州の裁判所命令にAIが生成した虚偽の法律引用が含まれる
ジョージア州最高裁への控訴審で、裁判所命令書に少なくとも5件の存在しない判例引用と、さらに5件の引用命題を支持しない判例引用が含まれていることが明らかになった。検察官が提出した原案にも同じ誤りがあった。

Claude Code v2.1.91 アップデート: エージェント設計パターン、メモリルール、およびツールの改善
Claude Code v2.1.91では、ツールのインターフェース設計、コンテキスト管理、キャッシュ戦略をカバーするエージェント設計パターンのリファレンスガイドが追加されました。このアップデートでは、メモリ選択ルールの簡素化、メモリ汚染に対するセキュリティ監視の追加、Edit、ReadFile、Write操作のツール説明の改善が行われています。

クラウドのオンボーディング体験で特定された4つのUX/製品ギャップ
ユーザーが、Claudeのデスクトップ版、Cowork、Dispatch、iPhoneアプリを実際に使用しながら設定する過程で、4つの具体的なUX/製品上のギャップを特定しました。問題点には、デスクトップがオフライン時のDispatchタスクの無限ループ、Dispatchでの単一永続スレッド、Chromeでのタブ固定型チャットパネル、モバイルアプリのナレッジベースUIでのGoogle Driveファイルの欠落が含まれます。

Autonomaの18か月にわたるコードベース書き換え:テスト、技術的負債、サーバーアクションに関する教訓
Autonomaは、エンジニアを2人から14人に拡大した後、1.5年分のコードを破棄しました。その理由として、テストの欠如、厳格でないTypeScriptの使用、およびServer Actionsの制限を挙げ、これらが書き直しの主な要因であると説明しています。