Tokenloser API-Gateway leitet KI-Verkehr zwischen Modellen, um Kosten zu halbieren

✍️ OpenClawRadar📅 Veröffentlicht: 30. Juli 2026🔗 Source
Ad

Tokenless (YC S26) ist ein Drop-in-API-Gateway, das KI-Inferenzkosten senkt, indem es jede Runde einer Agentenkonversation an das günstigste geeignete Modell weiterleitet. Die Gründer (Rohit, Andrew, Kev) kommen von Princeton, Google DeepMind und UC Berkeley und behaupten, dass ihr Router die Leistung von Claude Fable 5 zu halben Kosten erreicht.

Wie es funktioniert

Tokenless fragt eine Anfrage gleichzeitig bei mehreren Modellen an und beobachtet deren Fortschritt. Sobald ein Modell klar auf dem richtigen Weg ist, werden die anderen abgebrochen. Sie zahlen nur für die Nutzung des Gewinnermodells. Die Technik ist neuartig: Der Router fragt mehrere Modelle parallel ab und nutzt deren Zwischenergebnisse für die Routing-Entscheidung. Das Team weist auch darauf hin, dass ein Modellwechsel den Cache nicht zerstört, wenn der Routing-Algorithmus die Cache-Zustände (heiß/kalt) kennt.

Ad

Benchmarks

In den agentischen Benchmarks τ³-Banking, Terminal-Bench 2.1 und DeepSWE 1.1 erreicht Tokenless Pro eine Lösungsrate von 40,2% bei $0,57/Aufgabe, im Vergleich zu Claude Fable 5 mit 24,5% Lösungsrate und $3,32/Aufgabe. Der Ultra-Sparmodus routet aggressiver und erzielt eine Lösungsrate von 30,9% bei $2,25/Aufgabe. Die Zahlen werden als „gemessen, nicht vermarktet“ präsentiert – sie behaupten, alle führenden Modelle in der kostenbereinigten Qualität zu übertreffen.

Erste Schritte

Tokenless bietet einen OpenAI- und Anthropic-kompatiblen Endpunkt. Sie richten Ihren vorhandenen Agenten auf ihren Endpunkt und sie übernehmen das Routing. Neue Nutzer erhalten 20 $ Guthaben. Das Team plant, Kimi K3, GPT-Modelle und weitere Modelle in den Router aufzunehmen.

Kosteneinsparungsprognose

Tokenless stellt einen Rechner zur Verfügung: Für ein Team, das 40.000 $/Monat für LLMs ausgibt, prognostizieren sie eine neue Rechnung von 26.000 $/Monat (eine Ersparnis von 34%, 14.000 $/Monat weniger), was bei einer angenommenen monatlichen Ausgabensteigerung von 11% insgesamt 344.000 $ im nächsten Jahr einspart.

📖 Lesen Sie die vollständige Quelle: HN AI Agents

Ad

👀 Siehe auch

🦀
Werkzeuge

Hax: Ein minimalistischer Terminal-nativer Codierungs-Agent in C

Hax ist ein einzelnes natives C-Binary, das sofort startet, nur wenige MB RAM verbraucht und lokale LLMs als erstklassige Bürger behandelt. Es erkennt llama.cpp und andere Anbieter automatisch, ohne Konfigurationsblöcke.

OpenClawRadar
Implementierung von KI-Prüfungen mit Fortsetzung für quellengesteuerte PR-Überprüfungen
Werkzeuge

Implementierung von KI-Prüfungen mit Fortsetzung für quellengesteuerte PR-Überprüfungen

Continue integriert KI-Prüfungen direkt in Ihren Pull-Request-Workflow, indem es Markdown-Dateien als versionskontrollierte Prüfungen verwendet, die durch GitHub-Statusprüfungen sichtbar sind.

OpenClawRadar
OpenClaw Superkräfte: Eine Bibliothek mit 31 Fähigkeiten zur Lösung von Problemen in den Bereichen Sicherheit, Kosten und Zuverlässigkeit
Werkzeuge

OpenClaw Superkräfte: Eine Bibliothek mit 31 Fähigkeiten zur Lösung von Problemen in den Bereichen Sicherheit, Kosten und Zuverlässigkeit

Ein Entwickler hat openclaw-superpowers veröffentlicht, eine Bibliothek mit 31 Plug-and-Play-Fähigkeiten für OpenClaw. Die Bibliothek befasst sich mit häufigen Problemen wie außer Kontrolle geratenen API-Kosten, Sicherheitslücken und Kontextverlust und kann mit einem einzigen Befehl installiert werden.

OpenClawRadar
Zwei MCP-Tools für Claude Code: Ideenvalidierung und Trading-Agent-Speicher
Werkzeuge

Zwei MCP-Tools für Claude Code: Ideenvalidierung und Trading-Agent-Speicher

Ein Entwickler hat zwei MCP-Tools für Claude Code erstellt: idea-reality-mcp prüft GitHub und Hacker News vor dem Programmieren, um Duplikate zu vermeiden, während tradememory-protocol Speicher für KI-Handelsagenten bereitstellt, um Trades mit Kontext zu speichern und die Strategieleistung zu verfolgen. Beide sind Open Source und auf PyPI verfügbar.

OpenClawRadar