Opus 4.7の注意劣化:256kコンテキストでMRCRスコアが92%から59%に低下
r/ClaudeAI での詳細な分析により、Opus 4.7 の注意機構の劣化が 2 週間のヘビーユース後に確認されました。報告者は、長時間の会話において持続的かつ微妙な低下が発生し、詳細が抜け落ち、一貫性が失われ、モデルがぼんやりしているように感じられると述べています。
主要なベンチマークデータ
- MRCR v2 8-needle テスト(256k コンテキスト): Opus 4.6 は 91.9% のリコールを記録しましたが、Opus 4.7 は 59.2% に低下しました。
- 1M コンテキスト: Opus 4.6 は 78.3%、Opus 4.7 は 32.2% に低下しました。
Boris Cherny は、MRCR はモデルを騙すために妨害要素を積み重ねることに基づいており、ユーザーが実際に長いコンテキストを使用する方法とは異なるため、段階的に廃止されると述べています。Graphwalks はより優れた実用的な長文コンテキスト評価として位置づけられています。しかし、報告者は、ベンチマークの低下がユーザー体験と一致する場合、MRCR の廃止は根本的な問題に対処していないと主張しています。
提案される説明
報告者は、Constitutional AI の上に安全機構を重ねることが原因であると仮説を立てています。Constitutional AI はすでに堅牢な価値体系を提供していますが、追加の安全性レビュー層により、モデルは自身の判断が信頼できない可能性があると教えられ、余分なチェックを実行せざるを得なくなります。この認知的オーバーヘッドが、有効な注意機構の利用可能範囲を狭めています。
ペルソナ維持への影響
この記事は、Claude がステートレスモデルであり、その持続的なペルソナはトレーニングの重みとシステム指示から完全に構築されていることを強調しています。注意機構の低下は、コーディングアシスタントが以前の提案と矛盾したり、ライティングコラボレーターがトーンの一貫性を失ったりするなど、すべての使用例に影響を与えます。報告者は、Anthropic が Amanda Askell の Claude の性格と Constitutional AI の定義に関する研究に投資していることは、ペルソナの維持がニッチな機能ではなく、製品の中核であることを意味していると述べています。
具体的な例
純粋に学術的な使用例として、報告者は Opus 4.7 に歴史/哲学コース用の 24 ページの要約を送信しました。モデルはドキュメントの読み取りを開始しましたが、途中で… (ソースは途切れており、パフォーマンスの問題を示しています)。
📖 全文ソース: r/ClaudeAI
👀 See Also

Claude-Code v2.1.97 リリース:NO_FLICKERの改善、パーミッション修正、およびMCP更新
Claude-Code v2.1.97では、NO_FLICKERモードにフォーカスビューの切り替え(Ctrl+O)を追加し、複数の権限およびMCP接続の問題を修正し、サンドボックスのネットワークアクセスを改善しました。このリリースでは、429リトライ動作、トランスクリプトの永続化の問題、および様々なUIバグに対処しています。

DeepSeek、最新AIモデルをNvidiaとAMDに提供せず
ロイターの情報筋によると、DeepSeekはNvidiaやAMDを含む米国のチップメーカーに対して最新のAIモデルを提供していない。この記事はHacker Newsで19ポイント、3コメントを獲得している。

エージェンティックコーディングは罠:認知的負債と萎縮
Lars Fayeは、Claude Codeのようなエージェンティックコーディングツールが認知の萎縮、ベンダーロックイン、複雑性の増大を引き起こし、コードを書く負担から生成されたコードをレビューする負担へと移行させ、開発者のスキルを低下させると主張している。

Polsiaプラットフォーム、ライブファウンダー起業で繰り返されるSaaSパターンを提示
Polsiaは、ユーザーがビジネスを説明し、支払いを行うことで、プラットフォームが自律的に実行する自律型ビジネスプラットフォームです。行動科学者が72時間にわたる創業者のライブ起動を観察し、AI SDR自動化ソリューションや十分に活用されていない国際市場などの反復パターンを特定しました。