トークンレスAPIゲートウェイ、モデル間のAIトラフィックをルーティングしてコストを半減
Tokenless (YC S26) は、AI推論コストを削減するドロップインAPIゲートウェイです。エージェントの会話の各ターンを、最も安価で適切なモデルにルーティングします。創業者 (Rohit、Andrew、Kev) はプリンストン大学、Google DeepMind、UC Berkeley出身で、彼らのルーターはClaude Fable 5と同等のパフォーマンスを半分のコストで実現すると主張しています。
動作の仕組み
Tokenlessは、リクエストを複数のモデルに同時に送信(ファンアウト)し、その進捗を監視します。1つのモデルが明らかに正しい軌道に乗ったら、他のモデルをキャンセルします。支払いは、勝ったモデルの使用料のみです。この手法は斬新で、ルーターは複数のモデルに並行してクエリを送り、その中間出力を使ってルーティングを決定します。チームはまた、ルーティングアルゴリズムがキャッシュのホット/コールド状態を認識していれば、モデルを切り替えてもキャッシュが破壊されないと述べています。
ベンチマーク
τ³-Banking、Terminal-Bench 2.1、DeepSWE 1.1のエージェントベンチマークにおいて、Tokenless Proはタスクあたり$0.57で40.2%の解決率を達成しました。一方、Claude Fable 5はタスクあたり$3.32で24.5%の解決率です。Ultra Saverモードではより積極的にルーティングし、タスクあたり$2.25で30.9%の解決率となります。これらの数値は「測定値であり、マーケティングではない」とされており、コスト調整後の品質で全てのフロンティアモデルを上回ると主張しています。
始め方
TokenlessはOpenAIおよびAnthropic互換のエンドポイントを公開しています。既存のエージェントをこのエンドポイントに向けるだけで、ルーティングが行われます。新規ユーザーには$20の無料クレジットが提供されます。チームは今後、Kimi K3、GPTシリーズなどのモデルをルーターに追加する予定です。
コスト削減の見込み
Tokenlessは計算ツールを提供しています。LLMに月$40,000を費やしているチームの場合、新しい請求額は月$26,000になると予測されています(34%節約、月$14,000削減)。年間では、月11%の支出成長を仮定して、合計$344,000の節約が見込まれます。
📖 全文を読む: HN AI Agents
👀 See Also

alogin: ヒューマン・イン・ザ・ループを備えたAIエージェント向けGoベースのセキュリティゲートウェイ
aloginは、オープンソースのGoベースのセキュリティゲートウェイで、AIエージェントとインフラストラクチャの間に安全な経路を提供します。Claude Desktop向けの組み込みMCPサーバーサポート、人間介入型の安全対策、暗号化された認証情報ストレージを特徴としています。

MCP + スキルフレームワーク:効率的なデータサイエンスワークフローのためのAIエージェントのガイド
MCPサーバー+スキルフレームワークを用いてClaude/GPTエージェントをプラットフォーム認識型で効率的なデータサイエンスワークフローに制約する実践的アプローチ — クライアント重いコードや不必要なデータ移動を回避。

克劳德设计与华数设计:HTML布局与速率限制的直面交锋
Claude DesignはHTMLプロトタイプを高速に作成できますが、すぐにレート制限に達します。オープンソースのClaude CodeスキルであるHuashu-Designは、通常のサブスクリプションで動作し、個別のレート制限はありませんが、5分に対して20分かかります。

operate.txtの紹介:SaaS製品をナビゲートするAIエージェントのためのYAML仕様
開発者がoperate.txtを作成しました。これは、AIエージェントがコンピューター使用機能を利用する際の画面詳細、ローディング状態、不可逆的なアクション、段階的なパスを記録する、yourdomain.com/operate.txtでホストされるYAMLファイルです。この仕様は、正当なローディング画面中にClaudeが「これは壊れていますか?」と尋ねるような問題に対処します。