Claude Codeセッションで価値を最大化する:トークン効率化のヒント

Anthropicは、Claude Codeセッションで使うすべてのトークンから最大の価値を引き出すための実践的なガイドを公開しました。トークンの価格設定の仕組みを説明し、モデルを切り替えずに無駄を減らすための6つの具体的な戦術を提供しています。
トークンのコストを決めるもの
トークンごとに課金されますが、実際に支払っているのはGPU推論時間です。トークンの価格を決める3つの要素は、モデルのサイズ、入力と出力、キャッシュです。出力トークンは入力の約5倍のコストがかかります。なぜなら、デコードはトークンごとにモデルを1回実行するからです。キャッシュされた入力トークンはより安価で、プロンプトキャッシュは1時間で失効します。
トークンの無駄を減らす6つの方法
- タスク間で
/clearを実行する — 無関係な以前のコンテキストがモデルに送信されるのを防ぎ、トークン使用量を削減します。 - 開始前にモデルと努力レベルを設定する — 会話の途中で変更すると、プロンプトキャッシュが壊れ、コストが増加します。
- ファイル名を指定する代わりに@メンションを使用する — ファイルがメッセージに直接添付され、Read呼び出しやリポジトリ検索を節約できます。
- ノイズの多いコマンドに静かなフラグを追加するか、サブエージェントで実行する — コマンド出力はセッションの残り期間中会話に残ります。
- 新しいセッションで
/contextを1回実行する — 何が読み込まれているか(CLAUDE.md、MCPツール)が表示され、不要な項目を削除できます。 - 休憩前に
/compactを実行する — プロンプトキャッシュは1時間で失効し、キャッシュされている間に要約する方が安価です。
このガイドは、トークン効率を高めることは、全体的に使用量を減らすことではなく、使用するトークンを実際のタスクに確実に向けることだと強調しています。例えば、あるセッションでは、Claudeはテストとその対象ファイルを読み、編集し、数ターンで終了します。別のセッションでは、grepで周辺を検索し、同じ2つのファイルに到達するために十数個のファイルを読み、そのすべてのコンテキストを後続の各ターンに引きずり込み、コストがかかり、モデルが無関係なファイルについて考えることになります。
📖 全文を読む: HN AI Agents
👀 See Also

ローカルLLMとクラウドLLMの一貫したベンチマーク手法
開発者が、llama.cpp、vLLM、Ollamaなどのローカルモデルと、GPT-5.4、Claude Sonnet 4.6、Gemini 3.1 ProなどのクラウドAPIを、ZenMuxのような統一エンドポイントを通じて比較するために、順次リクエストとルールベースのスコアリングを使用した測定セットアップを共有しています。

OpenClaw:究極のクイックリファレンス・チートシート
OpenClawの詳細を、便利なリファレンスチートシートで探求しましょう。AIコーディング体験を効率化するための重要な機能と特徴を抽出します。

OpenClaw制御UIの接続切断問題の解決
Hostinger VPSでOpenClawを使用している際に発生する「Disconnected (1008): control ui requires HTTPS or localhost」エラーの解決方法を学びましょう。

ガイド:Lemonadeサーバーを介してWindowsでローカルLLMとGitHub Copilotを実行する方法
ある開発者が、Framework DesktopでLemonade Serverを使用してGitHub CopilotをローカルLLMと連携させるための手順を公開しました。これは、Windowsでのこの設定に関する簡単な手順が見つからなかったため作成されました。