Tokenloser API-Gateway leitet KI-Verkehr zwischen Modellen, um Kosten zu halbieren

✍️ OpenClawRadar📅 Veröffentlicht: 30. Juli 2026🔗 Source
Ad

Tokenless (YC S26) ist ein Drop-in-API-Gateway, das KI-Inferenzkosten senkt, indem es jede Runde einer Agentenkonversation an das günstigste geeignete Modell weiterleitet. Die Gründer (Rohit, Andrew, Kev) kommen von Princeton, Google DeepMind und UC Berkeley und behaupten, dass ihr Router die Leistung von Claude Fable 5 zu halben Kosten erreicht.

Wie es funktioniert

Tokenless fragt eine Anfrage gleichzeitig bei mehreren Modellen an und beobachtet deren Fortschritt. Sobald ein Modell klar auf dem richtigen Weg ist, werden die anderen abgebrochen. Sie zahlen nur für die Nutzung des Gewinnermodells. Die Technik ist neuartig: Der Router fragt mehrere Modelle parallel ab und nutzt deren Zwischenergebnisse für die Routing-Entscheidung. Das Team weist auch darauf hin, dass ein Modellwechsel den Cache nicht zerstört, wenn der Routing-Algorithmus die Cache-Zustände (heiß/kalt) kennt.

Ad

Benchmarks

In den agentischen Benchmarks τ³-Banking, Terminal-Bench 2.1 und DeepSWE 1.1 erreicht Tokenless Pro eine Lösungsrate von 40,2% bei $0,57/Aufgabe, im Vergleich zu Claude Fable 5 mit 24,5% Lösungsrate und $3,32/Aufgabe. Der Ultra-Sparmodus routet aggressiver und erzielt eine Lösungsrate von 30,9% bei $2,25/Aufgabe. Die Zahlen werden als „gemessen, nicht vermarktet“ präsentiert – sie behaupten, alle führenden Modelle in der kostenbereinigten Qualität zu übertreffen.

Erste Schritte

Tokenless bietet einen OpenAI- und Anthropic-kompatiblen Endpunkt. Sie richten Ihren vorhandenen Agenten auf ihren Endpunkt und sie übernehmen das Routing. Neue Nutzer erhalten 20 $ Guthaben. Das Team plant, Kimi K3, GPT-Modelle und weitere Modelle in den Router aufzunehmen.

Kosteneinsparungsprognose

Tokenless stellt einen Rechner zur Verfügung: Für ein Team, das 40.000 $/Monat für LLMs ausgibt, prognostizieren sie eine neue Rechnung von 26.000 $/Monat (eine Ersparnis von 34%, 14.000 $/Monat weniger), was bei einer angenommenen monatlichen Ausgabensteigerung von 11% insgesamt 344.000 $ im nächsten Jahr einspart.

📖 Lesen Sie die vollständige Quelle: HN AI Agents

Ad

👀 Siehe auch

OpenClaw-Einrichtung auf Ubuntu UTM-VM mit LLM-API und Ollama-Zugriff
Werkzeuge

OpenClaw-Einrichtung auf Ubuntu UTM-VM mit LLM-API und Ollama-Zugriff

Ein Benutzer hat OpenClaw erfolgreich in einer abgeschotteten Ubuntu-VM auf einem M3 Mac konfiguriert, mit Zugriff auf lokales Ollama unter macOS und externe LLM-APIs wie Gemini, Claude und DeepSeek. Beispielkonfigurationsdateien und Fehlerbehebungsnotizen sind auf GitHub verfügbar.

OpenClawRadar
Tycono: Open-Source KI-Agenten-Framework mit Organigramm und autonomen Verbesserungsschleifen
Werkzeuge

Tycono: Open-Source KI-Agenten-Framework mit Organigramm und autonomen Verbesserungsschleifen

Tycono ist ein Open-Source-Framework, in dem Sie KI-Agentenrollen in YAML (CTO, Ingenieur, QA usw.) definieren und sie zusammenarbeiten lassen, wobei sie einer Organisationsstruktur mit autonomen Verbesserungsschleifen folgen. Das System lief über Nacht 17 Runden für eine Pixel-Laufspielaufgabe und erzeugte dabei 6.796 Codezeilen über 43 Commits.

OpenClawRadar
Open-Source-Framework für persistente KI-Agenten-Speicherung mit lokaler Speicherung und graphenbasierter Abfrage
Werkzeuge

Open-Source-Framework für persistente KI-Agenten-Speicherung mit lokaler Speicherung und graphenbasierter Abfrage

Ein Entwickler baut ein Open-Source-Framework für persistente KI-Agenten-Speicherung, das Daten lokal als Markdown-Dateien speichert, Wiki-Links als Graphenkanten nutzt und Git für Versionskontrolle implementiert. Das System verfügt über eine Vier-Signal-Abruftechnik und grafikbewusstes Vergessen basierend auf der ACT-R-Kognitionswissenschaft.

OpenClawRadar
Netflix veröffentlicht VOID: Video-Objekt- und Interaktionslöschmodell auf Hugging Face
Werkzeuge

Netflix veröffentlicht VOID: Video-Objekt- und Interaktionslöschmodell auf Hugging Face

Netflix hat VOID veröffentlicht, ein Video-Inpainting-Modell, das Objekte aus Videos entfernt, einschließlich aller physischen Interaktionen, die sie auslösen, wie fallende Objekte und verschobene Gegenstände. Das Modell benötigt eine GPU mit 40 GB+ VRAM und verwendet Quadmask-Conditioning mit zwei Checkpoint-Dateien für verschiedene Verfeinerungsstufen.

OpenClawRadar