Claude Fable 5.1とMythos 5.1: 同じモデル、異なる安全対策
AnthropicはClaude Fable 5.1とClaude Mythos 5.1をリリースしました。同じ基盤モデルですが、安全性のレベルが異なります。Fable 5.1は一般提供が開始され、Mythos 5.1はサイバーセキュリティとライフサイエンス向けの信頼できるアクセスプログラムに限定されています。
価格とデータ保持
Fable 5.1の価格は、トークン課金の一般的なワークロードでFable 5と比較して約25%安くなりました。キャッシュリード(既に処理され格納された入力)の価格が引き下げられたためです。高度にエージェントな作業では、削減効果は最大45%に達します。
エンタープライズ向けフロンティア保護(EFS)により、顧客は完全なプライバシーを確保できます。データはAnthropicのクラウドではなく、顧客管理のクラウドインフラに保存されます。EFSは2025年秋から段階的に展開されます。それまでは、資格のある顧客はFable 5.1でデータ保持ゼロを利用できます。
ベンチマーク
Fable 5.1は全体的にパフォーマンスが向上しています。ソースからの主な数値は以下の通りです:
- Terminal-Bench-Science 0.1: Fable 5.1は約50%の精度を達成し、Fable 5の約25%を上回ります(コストは同程度)。
- Terminal-Bench 4.0: 各努力レベル(低/中/高/超高/最大)で、Fable 5.1はFable 5を上回ります。FableとMythosの差は、サイバー保護の改善により縮小すると予想されます。
- Humanity's Last Exam: Fable 5.1はツール使用時、最大努力で約65%の合格率を示し、コスト上限に達する前に良好な結果を出しています。
- CursorBench 3.2.0: Fable 5.1は
高努力で約72%のスコアを達成し、Fable 5の約65%を上回ります。
Fable 5.1は、Claude Codeではデフォルトで高努力、Claude CoworkとClaude.aiでは中努力に設定されています。低い努力設定でも、コストが低くFable 5と同等の結果が得られます。
保護機能の改善
サイバーセキュリティにおける誤検出(良性コンテンツがフラグされること)は60%減少しました。モデルはソフトウェアの脆弱性を発見できるようになりましたが、エクスプロイトの開発はできません。生物学分野では、米国政府と協力したアクセスプログラムが開始され、科学者の登録が間もなく始まります。
実際の影響
投資会社ミレニアムは、Fable 5.1が自社の内部システムで発生した稀なクラッシュの根本原因を発見したと報告しました。これは、エンジニアや他のモデルが何年も試みても説明できなかったものです。
📖 全文はこちら: HN AI Agents
👀 See Also

TranslateGemma-12b: 自動評価指標が見逃したエラーの71%を人間のレビューが発見
人間によるMQMレビューにより、自動評価指標で問題なしとされた翻訳セグメントの71%にフラグが立てられ、25件の正確性エラーはすべて指標が検出できない領域にありました。

プロンプティングから仕様エンジニアリングへ:プランナー・ワーカーアーキテクチャの転換
AI開発は、単純なチャットベースのプロンプトから、人間が仕様エンジニアとして機能するプランナー・ワーカーアーキテクチャへと移行しています。これには、自律型AIエージェントのための厳格な受入基準、制約アーキテクチャ、および分解パターンの定義が必要です。

インターネット・アーカイブのブロックはウェブの歴史保存を脅かす
ニューヨーク・タイムズを含む主要出版社が、robots.txtを超えた技術的手段でインターネットアーカイブのクローラーをブロックしており、歴史的なウェブ記録の喪失リスクが生じています。アーカイブのWayback Machineには1兆以上のアーカイブページが保存され、ウィキペディアは249言語にわたる260万件の保存ニュース記事にリンクしています。

OpenAIの100億ドルPEジョイントベンチャー:AI展開への影響
OpenAIがプライベートエクイティ企業と100億ドルの合弁事業を最終決定し、AIインフラとエンタープライズ展開を拡大する(ブルームバーグ報道)。