Безтоковый API-шлюз маршрутизирует ИИ-трафик между моделями, сокращая расходы вдвое

✍️ OpenClawRadar📅 Опубликовано: 30 июля 2026 г.🔗 Source
Ad

Tokenless (YC S26) — это подключаемый API-шлюз, который сокращает расходы на AI-инференс, направляя каждый шаг диалога агента на самую дешевую адекватную модель. Основатели (Рохит, Эндрю, Кев) из Принстона, Google DeepMind и UC Berkeley утверждают, что их маршрутизатор достигает производительности Claude Fable 5 вдвое дешевле.

Как это работает

Tokenless одновременно отправляет запрос нескольким моделям и отслеживает их прогресс. Как только одна модель явно на правильном пути, он отменяет остальные. Вы платите только за использование победившей модели. Техника нова: маршрутизатор запрашивает несколько моделей параллельно и использует их промежуточные результаты для принятия решения о маршрутизации. Команда также отмечает, что переключение моделей не уничтожает кэш, если алгоритм маршрутизации учитывает состояние горячего/холодного кэша.

Ad

Бенчмарки

На агентских бенчмарках τ³-Banking, Terminal-Bench 2.1 и DeepSWE 1.1 Tokenless Pro достигает 40,2% решаемости при $0,57/задача, против 24,5% и $3,32/задача у Claude Fable 5. Режим Ultra Saver маршрутизирует агрессивнее: 30,9% решаемости при $2,25/задача. Цифры представлены как «измеренные, не разрекламированные» — утверждается, что они превосходят все передовые модели по качеству с поправкой на стоимость.

Начало работы

Tokenless предоставляет совместимую с OpenAI и Anthropic конечную точку. Вы направляете существующего агента на их точку, а они занимаются маршрутизацией. Новые пользователи получают $20 бесплатного кредита. Команда планирует добавить Kimi K3, усилия GPT и другие модели.

Прогноз экономии

Tokenless предоставляет калькулятор: для команды, тратящей $40K/мес на LLM, прогнозируется новый счет в $26K/мес (экономия 34%, $14K/мес), всего $344K сэкономлено за следующий год при 11% ежемесячном росте расходов.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

🦀
Инструменты

Wakehook: Запуск утренних автоматизаций OpenClaw по фактическому времени пробуждения, а не по Cron

Wakehook считывает данные о сне из Google Health/Fitbit и отправляет POST-запрос с событием user.awake в OpenClaw, когда вы действительно просыпаетесь. Самостоятельно развертываемый, поллинговый, не требует публичного URL.

OpenClawRadar
Бенчмарк квантизации Qwen 3.6 27B: Q4_K_M превосходит Q8_0 по практическим компромиссам
Инструменты

Бенчмарк квантизации Qwen 3.6 27B: Q4_K_M превосходит Q8_0 по практическим компромиссам

Оценка Qwen 3.6 27B в квантованиях BF16, Q4_K_M и Q8_0 GGUF на задачах HumanEval, HellaSwag и BFCL. Q4_K_M обеспечивает точность, близкую к BF16, при 48% меньшем потреблении RAM, скорости в 1,45 раза выше и размере файла на 68,8% меньше.

OpenClawRadar
Architor: Инструмент с открытым исходным кодом для фазово-управляемых архитектурных рабочих процессов с использованием Claude Code
Инструменты

Architor: Инструмент с открытым исходным кодом для фазово-управляемых архитектурных рабочих процессов с использованием Claude Code

Architor — это инструмент с открытым исходным кодом, который структурирует Claude Code в поэтапного архитектурного ассистента с постоянной памятью о проекте. Он организует проектирование системы на этапы оценки требований, принятия архитектурных решений, проектирования компонентов и валидации, отслеживая решения в рабочей области .arch.

OpenClawRadar
Круглый стол по ИИ: Инструмент для сравнения 200+ моделей ИИ на структурированных вопросах
Инструменты

Круглый стол по ИИ: Инструмент для сравнения 200+ моделей ИИ на структурированных вопросах

AI Roundtable — это бесплатный инструмент, который позволяет пользователям задавать вопросы с определенными вариантами ответов, выбирать до 50 моделей из пула более чем 200+ и получать структурированные ответы в идентичных условиях. Он также включает функцию дебатов, где модели могут видеть рассуждения друг друга, и модель-рецензента, которая суммирует транскрипты.

OpenClawRadar