「簡潔さ」がClaude Code圧縮ベンチマークで原始人プラグインを破る

Max Taylor氏が人気のClaude Code圧縮プラグイン「caveman」を、自明なベースライン(各プロンプトに「簡潔に」と前置きする)と比較ベンチマークした。結果は驚くほど平坦だが、プラグインが実際に価値を発揮する場面が明らかになった。
ベンチマーク手法
6カテゴリ(バグ診断、概念説明、アーキテクチャのトレードオフ、マルチステップ設定、セキュリティ/破壊的操作、エラー解釈)にわたる24のプロンプト。各プロンプトには、必須のキーポイント、必須用語、禁止される主張を含む評価基準が設定された。5つのアームをテスト:ベースライン(指示なし)、「簡潔に」、cavemanの3つの強度レベル(Lite、Full、Ultra)。すべてclaude-opus-4-7でclaude -pを使用して実行。応答はclaude-sonnet-4-6が評価基準に照らしてスコアリングした。
品質結果
すべてのアームが互いに1.5%以内のスコア差に収まった:
- ベースライン:0.985
- 簡潔に:0.985
- Lite:0.976
- Full:0.975
- Ultra:0.970
すべてのアームがキーポイントを100%達成。120の応答全体で禁止される主張はゼロ。圧縮による実質的な内容の低下はなかった。
トークン数
| アーム | 平均トークン数 |
|---|---|
| ベースライン | 636 |
| 簡潔に | 419(34%削減) |
| Lite | 401 |
| Full | 404 |
| Ultra | 449 |
「簡潔に」はベースライン比34%のトークン削減。cavemanのLiteとFullは「簡潔に」に近い値。最も厳しいモードであるUltraは3つの中で最も長い回答を生成したが、カテゴリ別に見ると異なるストーリーが浮かび上がる。
カテゴリ別に見るcavemanの設計思想
バグ診断、概念説明、アーキテクチャのトレードオフ、エラー解釈では、Ultraが最短または同等。圧縮は宣伝通りに機能する。マルチステップ設定とセキュリティ警告では、すべてのcavemanモードでトークン数が増加。その理由は、cavemanの「Auto-Clarity」ルールが、安全警告、不可逆的な操作、マルチステップシーケンスに対して圧縮を明示的に無効にするため。安全エスケープが作動し、圧縮が停止する。これは設計上の特徴である。
では、cavemanは実際に何のためにあるのか?
「簡潔に」がトークン数と品質で同等なら、プラグインの価値は構造面にある:
- 一貫した出力形状 — すべての応答が同じパターンに従い、ダウンストリームのツールや統一感のあるセッション体験に有用。
- 強度のダイヤル — スラッシュコマンドでセッション中にLite/Full/Ultraを切り替え可能。
- 長期セッションでの持続性 — cavemanは
SessionStartおよびUserPromptSubmitフックを介してルールセットを再注入し、ドリフトを防止(この単発ベンチマークでは未テスト)。
完全なデータセットとハーネスはオープンソース。
📖 全文ソース: HN AI Agents
👀 See Also

Chrome拡張機能がClaude Code Webにライブプレビュー機能を追加
Claude Code PreviewというChrome拡張機能が、Claude Code Webにライブプレビュー機能を追加し、Lovableや他の「バイブコーディング」サイトと同様に、デプロイメントを並べて表示できるようにします。

オープンソースのCLIは、Xeroの経費監査を自動化するためにClaude Haikuを使用します。
開発者が、Xeroの経費監査を自動化するためにClaude Haiku 4.5を使用するオープンソースのPython CLIツールを公開しました。このツールは「まず決定論的なコードで処理し、足りない部分をAIで補う」というアプローチを採用しており、1回の監査実行にかかるコストを数セントに抑えています。

发现的问题插件记录Claude在处理其他任务时忽略的错误
Claude Codeプラグイン。エージェントがスコープ外でバグを発見した際に、docs/found-issues.mdに1行のエントリを記録し、PRマージ時に自動クローズ、トゥームストーン検出機能を備えています。

OpenClaw Memory-Core用外部リランカープラグイン:古いGPUを再利用する
開発者がOpenClaw用のプラグインを公開。メモリーコアが外部リランカーを使えるようになり、CPU負荷の高いQMDを回避して古いGPUを活用。Qwen3モデルで動作。