Tokenloser API-Gateway leitet KI-Verkehr zwischen Modellen, um Kosten zu halbieren
Tokenless (YC S26) ist ein Drop-in-API-Gateway, das KI-Inferenzkosten senkt, indem es jede Runde einer Agentenkonversation an das günstigste geeignete Modell weiterleitet. Die Gründer (Rohit, Andrew, Kev) kommen von Princeton, Google DeepMind und UC Berkeley und behaupten, dass ihr Router die Leistung von Claude Fable 5 zu halben Kosten erreicht.
Wie es funktioniert
Tokenless fragt eine Anfrage gleichzeitig bei mehreren Modellen an und beobachtet deren Fortschritt. Sobald ein Modell klar auf dem richtigen Weg ist, werden die anderen abgebrochen. Sie zahlen nur für die Nutzung des Gewinnermodells. Die Technik ist neuartig: Der Router fragt mehrere Modelle parallel ab und nutzt deren Zwischenergebnisse für die Routing-Entscheidung. Das Team weist auch darauf hin, dass ein Modellwechsel den Cache nicht zerstört, wenn der Routing-Algorithmus die Cache-Zustände (heiß/kalt) kennt.
Benchmarks
In den agentischen Benchmarks τ³-Banking, Terminal-Bench 2.1 und DeepSWE 1.1 erreicht Tokenless Pro eine Lösungsrate von 40,2% bei $0,57/Aufgabe, im Vergleich zu Claude Fable 5 mit 24,5% Lösungsrate und $3,32/Aufgabe. Der Ultra-Sparmodus routet aggressiver und erzielt eine Lösungsrate von 30,9% bei $2,25/Aufgabe. Die Zahlen werden als „gemessen, nicht vermarktet“ präsentiert – sie behaupten, alle führenden Modelle in der kostenbereinigten Qualität zu übertreffen.
Erste Schritte
Tokenless bietet einen OpenAI- und Anthropic-kompatiblen Endpunkt. Sie richten Ihren vorhandenen Agenten auf ihren Endpunkt und sie übernehmen das Routing. Neue Nutzer erhalten 20 $ Guthaben. Das Team plant, Kimi K3, GPT-Modelle und weitere Modelle in den Router aufzunehmen.
Kosteneinsparungsprognose
Tokenless stellt einen Rechner zur Verfügung: Für ein Team, das 40.000 $/Monat für LLMs ausgibt, prognostizieren sie eine neue Rechnung von 26.000 $/Monat (eine Ersparnis von 34%, 14.000 $/Monat weniger), was bei einer angenommenen monatlichen Ausgabensteigerung von 11% insgesamt 344.000 $ im nächsten Jahr einspart.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

Graft: Claude-Code-Hooks reduzieren grep-Tokens um 42 %
Graft erstellt einen persistenten Wissensgraph für Coding-Agenten, reduziert Tool-Aufrufe um 46%, Tokens um 42% und verbessert die SWE-bench-Korrektheit von 54% auf 66%.

Claude Codes lokale Gedächtnisintegration mit Shodh: Verbesserung der Kontextbeibehaltung über die Zeit
Entdecken Sie die Integration von Claude Code mit Shodh-Speicher zur langfristigen Beibehaltung des Projektkontextes mithilfe eines lokalen Speicherservers.

Void-Box-Update fügt sandboxed OpenClaw-Telegram-Integration über KVM-Micro-VMs hinzu
Void-Box, eine leistungsfähige Laufzeitumgebung für KI-Agenten, enthält nun ein funktionierendes Beispiel, das OpenClaw mit Telegram verbindet und vollständig abgeschottet in isolierten KVM-Mikro-VMs läuft. Das System erstellt Mikro-VMs bei Bedarf für jede Ausführungsphase und zerstört sie anschließend, um Zustandslecks zu verhindern.
xAI TTS-Integration für Home Assistant mit Claude erstellt — Vollständiges Repo
Ein Entwickler nutzte Claude, um eine benutzerdefinierte Home Assistant-Integration für xAIs TTS-API (Eve-Stimme) mit vollständiger UI-Konfiguration, fünf Stimmen und Sprach-Tags zu erstellen.