原始人対「簡潔に」プロンプト:Claude向け圧縮プロンプトのベンチマーク

開発者がキャブマン(人気の省略圧縮プロンプト)を単純なプロンプト「簡潔に。」とベンチマークし、余分な複雑さが実際に効果を発揮するかどうかを調べました。テストでは、6つのカテゴリにわたる24の開発プロンプトを実行し、5つのアーム(ベースライン、「簡潔に。」、キャブマンライト、キャブマンフル、キャブマンウルトラ)を比較しました。出力は、プロンプトごとのルーブリックを使用して別のClaudeインスタンスによって評価されました。
ベンチマーク結果
- ベースライン: 平均スコア0.985、平均トークン数636
- 「簡潔に。」: 平均スコア0.985、平均トークン数419
- キャブマンライト: 平均スコア0.976、平均トークン数401
- キャブマンフル: 平均スコア0.975、平均トークン数404
- キャブマンウルトラ: 平均スコア0.970、平均トークン数449
2語のバージョンは、圧縮と品質の両方でキャブマンに匹敵しました。しかし、キャブマンの価値は別のところにあります。一貫した出力構造、モード切り替え、破壊的操作に対する安全エスケープです。安全エスケープは実際に出力品質に大きなばらつきをもたらし、特定のユースケースでは懸念事項となる可能性があります。
各カテゴリのデータと安全性に関する質問のばらつきの結果を含む完全な内訳は、作者のサイトでご覧いただけます。ベンチマークハーネスはGitHubでオープンソースとして公開されています。
📖 全文を読む: r/ClaudeAI
👀 See Also

ジョージア州のAIデータセンター、計量されていない水2900万ガロンを使用
QTSファイエットビルキャンパスは、無許可の2つの水道接続を介して15か月間に2900万ガロンの水を消費し、低水圧の苦情を引き起こしました。郡は罰金を免除し、14万7千ドルの遡及料金を請求しました。

Claude Code v2.1.37 リリースされました
Anthropicは、Claude Codeの新バージョンをリリースし、改善とバグ修正を行いました。

危険すぎるコード読み飛ばし:LLMがあなたが読むより速くコードを書くとき
LLMが生成したコードをレビューするのをやめて、マシンコードのように扱うとしたらどうだろう?厳密性の焦点を仕様とテストに移そう。

スタンフォード大学2026年AIインデックスレポート:投資・モデル・社会認識における主要トレンド
スタンフォード大学の2026年AIインデックスレポートによると、AIへの投資が急増している一方で、雇用への影響や一般の認識は依然として混在しています。2025年には米国企業が50の注目すべきAIモデルをリリースし、中国がその差を縮めつつあります。