NerfGuard: コード要求をより安価なモデルにルーティングし、コストを3倍削減する分類器

Claude CodeからCodexへ速度と操作性の向上を求めて移行したチームは、トークン課金の高さに苦しんでいました。日々の請求額は驚くほどで、簡単なタスクにも最高級モデルを最大推論で使っていることに気づきました。そこで彼らはNerfGuardを開発しました——各リクエストを必要最低限のモデルと推論深度にルーティングする高速分類器です。
核となるのは、与えられたコーディングリクエストに必要な最小限の知能を判定する分類器です。その上で、自動トークン効率化技術を適用します。結果として、トークン消費を大幅に抑えつつほぼ同じ品質を維持し、知能と推論が適切に分配されるため、速度も大幅に向上します。チームは最大3倍の節約と、ツールの応答待ち時間で1人あたり1日数時間の節約を観測しました。
ソースからの主な詳細:
- 分類器が各リクエストに最安のモデル+推論深度をルーティング
- 追加の自動トークン効率化技術
- 結果:同じ支出で3倍の利用
- 速度改善:1人あたり1日数時間の節約
- スロットリング制限に達する前により多くの利用
現在、複数のAI企業のエンジニアが使用しています。ツールはnerfguard.comで入手可能です。
対象:コーディングエージェント(Claude Code、Codexなど)を使用し、支出あたりのアウトプットを最大化し待ち時間を減らしたいチーム。
📖 原文を読む: HN AI Agents
👀 See Also

AI-Setup CLIツールは、ローカルLLMスタック用のAI設定ファイルを自動生成します。
AI-Setupは、コードベースをスキャンし、.cursorrulesやclaude.mdなどのAI設定ファイルを自動生成するCLIツールです。使用している技術スタックを検出するため、新しいプロジェクトごとに手動でルールを書く必要がなくなります。

セッションサイフォン:オープンソースツールがAIコーディングエージェントの会話を統合
Session Siphonは、複数のAIコーディングエージェントの会話履歴を統合・インデックス化する無料のオープンソースツールです。開発者は、異なるプラットフォーム間での会話の追跡という課題を解決するためにClaudeを使用して作成しました。

ローカル書籍翻訳パイプラインは、コンテキストRAGを活用したQwen 32BとMistral 24Bを使用しています
開発者が、8つのPythonスクリプトを使用してPDFファイルをePub形式に変換する完全ローカルの自動化された書籍翻訳パイプラインを作成しました。このシステムは、マルチステップのワークフローを通じて、文脈の喪失やフォーマットの問題といった一般的な翻訳課題に対処します。

HTMLアーティファクトは技術文書向けにGoogleドキュメントを代替するが、コメント機能が不足している
Claudeが生成するHTMLアーティファクトが、スパイク読み取りやアーキテクチャノートなどの長文の技術コンテンツでGoogleドキュメントに取って代わりつつあるが、サンドボックス化されたiframeの性質上、インラインコメントやレビュー機能が利用できない。