Measuring Off-Task Token Spend in Claude Code: The 'Undeclared-Intent' Metricを日本語に訳すと:

Claude Code用のカスタムフックを開発しているプログラマーが、undeclared-intent spend(未宣言の意図に基づく消費)という指標を作成し、宣言された目的外でのトークン使用量を測定した。
主な発見
- あるセッションでは、総計算量が5,137トークンで、そのうち1,173トークン(22.8%)が未宣言、3,964トークン(77.2%)が宣言済みに分類された。
- 未宣言消費は、リトライ、ループ、推論の逸脱、タスク外の実行にかかるコストを捉えるものであり、単なるガバナンス違反だけを対象としていない。
- この指標はコストを行動のシグナルとして扱い、単なる課金テレメトリではない。
実装上の課題
フックの表面では、真の逸脱と意図の判別不能を区別するのに十分なコンテキストが常に得られるわけではない。著者は2つの異なる障害モードを指摘している:真の逸脱(無関係なファイルやシステムに迷い込んだ場合)とフックデータからは判別不能な場合である。モードごとに異なる対応が必要となる。
出力形式の例:
Total compute 5,137 tokens
Undeclared 1,173 tokens (22.8%)
Declared 3,964 tokens (77.2%)
ソースにはツールやライブラリは共有されておらず、この投稿は議論を促すためのものである。著者は、他の開発者がタスク外の計算を測定しているのか、それともトークン消費を単なる課金や最適化の問題として扱っているのかに関心を持っている。
📖 原文を読む: r/ClaudeAI
👀 See Also

Superglue CLI: AIエージェントが事前構築ツールなしでAPIコールを実行可能に
Superglue CLIは、AIコーディングエージェントにそのコマンドの使用方法、認証処理、ツール構築、失敗のデバッグ方法を教えるスキルを提供します。すべてのAPI統合に対して事前構築されたツールを作成する代わりに、エージェントは実行時にAPI仕様を読み取り、複数ステップの呼び出しを計画できます。
MathCode:一个具备Lean 4形式化的数学编码智能体
MathCodeは、ターミナル上で動作するAIコーディングアシスタントで、平易な英語の問題をLean 4の定理に変換し、形式的証明を試みます。永続的なREPL、再利用可能なライブラリ、Obsidianのナレッジグラフを備えています。

人間の創造性ベンチマーク:AI創造性評価における収束と発散の分離
Contra Labsは、生成的AIのクリエイティブ作業における評価において、客観的に検証可能な基準(例:プロンプトへの忠実さ)と主観的な好み(例:視覚的魅力)を区別するフレームワーク「Human Creativity Benchmark (HCB)」を発表しました。このベンチマークは、現時点で正確かつ操作可能なモデルは存在せず、モード崩壊と差別化された出力の必要性に光を当てています。

クロード・コードをドリフトなしで夜間の無人セッションで実行するためのパターン
3つの要素—チェーンランナー、スーパーバイザー、そして単一のハンドオフ契約—が、数時間にわたる自律型Claude Codeセッションにおけるフィードバックループのドリフト問題を解決します。