Claude Opus 5.5:Opus 5より40%安価、Terminal-Bench 4.0で66.4%
Anthropicは新しいClaude 5.5ファミリーの第一弾となるClaude Opus 5.5をリリースした。ほとんどの作業でClaude Fable 5.1相当の性能を発揮しながら、実行コストはOpus 5より40%低い。入力・出力トークンの価格はそれぞれ100万トークンあたり$4と$20——Opus 5より20%安い——一方、Anthropicによればエージェントやコーディング作業のコストの大半を占めるキャッシュ読み取りは100万トークンあたり$0.20まで下がり、60%の削減となる。出力の生成速度はOpus 5より30%以上高速だ。
ベンチマーク
Opus 5.5はエージェント型コーディング、コンピュータ操作、ナレッジワークの各分野で首位に立つ:
- Terminal-Bench 4.0: 66.4%(Fable 5.1は55.8%、Opus 5は52.3%、GPT-6 Astraは57.9%、GPT-5.6 Solは37.3%)
- FrontierCode v1.1 (Main): 54.4%(Fable 5.1: 50.3%、Opus 5: 48.0%)
- CursorBench 4.0: 57.8%(Fable 5.1: 51.8%、Opus 5: 46.6%)
- GDPval-AA v2.1: 1846(Fable 5.1: 1735、Opus 5: 1708)
- AutomationBench: 40.0%(Fable 5.1: 31.4%、Opus 5: 26.9%)
- Humanity's Last Exam: ツール使用時67.7%(Fable 5.1: 65.6%、Opus 5: 63.6%)
- Terminal-Bench-Science 0.1: 58.7%(Fable 5.1: 52.6%、Opus 5: 29.0%、GPT-6 Astra: 64.6%)
Anthropicは、この水準ではベンチマークの差が実世界の違いを示す指標として以前ほど信頼できなくなっており、Opus 5.5とFable 5.1の実用上の差はスコアが示唆するよりも小さいと注記している。
報告されたワークロード
あるテスターは68万行のコード移行を1日足らずで完了した。Webアプリの全ページで読み込み時間を短縮する社内テストでは、Opus 5.5は40回中39回成功——Opus 5はより小さな改善にとどまり、しかもアプリの挙動を変えてしまった。別のテスターは複数のClaudeモデルに単一のプロンプトからゲームを作らせ、Opus 5.5がグラフィックスと完成度で最高スコアを得た。
安全性と検証
Opus 5.5は、数千のシミュレーションシナリオでClaudeをテストするAnthropicの自動行動監査において過去最高スコアを記録した。最近のモデルよりも取り返しのつきにくい行動を取ったり、与えられた境界の外で行動したりする可能性が低く、Opus 5よりもプロンプトインジェクションに耐性がある。テストは現在、より長いタスク、不可能なタスク、実際のインシデントをモデル化したシナリオをカバーしている。生物学とサイバーセキュリティにおいてClaude Mythos 5.1と同等であるため、AnthropicはClaude Fable 5.1と同様のセーフガードを適用して展開している。
審査済みの組織は生物学研究用途のためにライフサイエンス検証プログラムに申請できる。サイバー検証プログラムは今後数週間で認定実務者向けに拡大する。
制限と提供状況
Pro、Max、Team、およびシート単位のEnterpriseプランにおける5時間の使用制限が引き上げられる。サブスクリプションユーザーには、保存していつでも使えるレート制限リセットが付与される。Claude Sonnet 5.5とClaude Haiku 5.5が、性能・効率・安全性における同様の改善を伴って今後数週間で続く。
📖 Read the full source: HN AI Agents
👀 See Also

「コードは決して難しい部分ではなかった」は全プログラマーへの侮辱だ
Senko Rašić氏は、「コーディングは簡単で、何を作るかを考えるのが難しい」という主張に反論し、両方とも難しいと論じ、その考えを退けることは有害だと述べています。

AIチップコストの63%をメモリが占める:HBM支出が320億ドルに到達
Epoch AIのデータによると、AIチップのコンポーネントコストに占めるHBMメモリの割合は、2024年第1四半期の52%から2025年第4四半期には63%に上昇。総コンポーネント支出は220億ドルから520億ドルに増加し、その増加分のうち200億ドルをHBMが占めています。

自己ミスによる自己教師ありファインチューニングで小規模モデルがHumanEval 80%達成
ある開発者がQwen 2.5 7Bを自分で生成したコーディングペアで学習させ、人間が書いた学習データを一切使わずにHumanEvalで112/164(+87問題)を達成しました。このアプローチはLlama 3.2 3BやQwen 3 4Bにも転用可能です。

Claude Code v2.1.91 アップデート: エージェント設計パターン、メモリルール、およびツールの改善
Claude Code v2.1.91では、ツールのインターフェース設計、コンテキスト管理、キャッシュ戦略をカバーするエージェント設計パターンのリファレンスガイドが追加されました。このアップデートでは、メモリ選択ルールの簡素化、メモリ汚染に対するセキュリティ監視の追加、Edit、ReadFile、Write操作のツール説明の改善が行われています。