トークンレスAPIゲートウェイ、モデル間のAIトラフィックをルーティングしてコストを半減
Tokenless (YC S26) は、AI推論コストを削減するドロップインAPIゲートウェイです。エージェントの会話の各ターンを、最も安価で適切なモデルにルーティングします。創業者 (Rohit、Andrew、Kev) はプリンストン大学、Google DeepMind、UC Berkeley出身で、彼らのルーターはClaude Fable 5と同等のパフォーマンスを半分のコストで実現すると主張しています。
動作の仕組み
Tokenlessは、リクエストを複数のモデルに同時に送信(ファンアウト)し、その進捗を監視します。1つのモデルが明らかに正しい軌道に乗ったら、他のモデルをキャンセルします。支払いは、勝ったモデルの使用料のみです。この手法は斬新で、ルーターは複数のモデルに並行してクエリを送り、その中間出力を使ってルーティングを決定します。チームはまた、ルーティングアルゴリズムがキャッシュのホット/コールド状態を認識していれば、モデルを切り替えてもキャッシュが破壊されないと述べています。
ベンチマーク
τ³-Banking、Terminal-Bench 2.1、DeepSWE 1.1のエージェントベンチマークにおいて、Tokenless Proはタスクあたり$0.57で40.2%の解決率を達成しました。一方、Claude Fable 5はタスクあたり$3.32で24.5%の解決率です。Ultra Saverモードではより積極的にルーティングし、タスクあたり$2.25で30.9%の解決率となります。これらの数値は「測定値であり、マーケティングではない」とされており、コスト調整後の品質で全てのフロンティアモデルを上回ると主張しています。
始め方
TokenlessはOpenAIおよびAnthropic互換のエンドポイントを公開しています。既存のエージェントをこのエンドポイントに向けるだけで、ルーティングが行われます。新規ユーザーには$20の無料クレジットが提供されます。チームは今後、Kimi K3、GPTシリーズなどのモデルをルーターに追加する予定です。
コスト削減の見込み
Tokenlessは計算ツールを提供しています。LLMに月$40,000を費やしているチームの場合、新しい請求額は月$26,000になると予測されています(34%節約、月$14,000削減)。年間では、月11%の支出成長を仮定して、合計$344,000の節約が見込まれます。
📖 全文を読む: HN AI Agents
👀 See Also

AIを小さなボットで探求:ナノボットチューターを通じてAIエージェントを理解する
OpenClawコミュニティのメンバーが、AIエージェントの機能を解明することを目的としたミニチュアフレームワーク『ナノボットチューター』に関する洞察を共有しています。このコンパクトな学習環境に飛び込むことで、知的エージェントの仕組みがどのように明らかになるのかを発見してください。

ジェミニ3.1 Proのマルチエージェントシステム:高い設計品質、20%のツール呼び出し失敗率
マルチエージェントアーキテクチャを採用したAIプレゼンテーション生成ツール「Bobr」を開発しているチームは、Gemini 3.1 Proが印象的なデザイン出力を生成する一方で、本番パイプラインにおいて約20%のツール呼び出し失敗率と文字化けしたテキストの破損に悩まされていると報告しています。

SpecLock: AIコーディングエージェント向けオープンソース制約エンジン
SpecLockは、Claude CodeなどのAIコーディングエージェントに対して制約を積極的に適用するMCPサーバーです。同義語の拡張、否定検出、破壊的アクションのフラグ付けを使用して、意味的な競合警告で違反をブロックします。

ターミナルベースの3Dレンダラー - マルチエージェントClaudeコードシステムで構築
開発者がtortuiseを作成しました。これは、UnicodeとASCII記号を使用してガウススプラットを表示する、純粋なターミナルベースの3Dレンダラーです。Claude Codeセットアップを通じて、サブエージェント内にさらにサブエージェントを持つ70〜80のAIエージェントを調整し、3日間で構築されました。