Безтоковый API-шлюз маршрутизирует ИИ-трафик между моделями, сокращая расходы вдвое
Tokenless (YC S26) — это подключаемый API-шлюз, который сокращает расходы на AI-инференс, направляя каждый шаг диалога агента на самую дешевую адекватную модель. Основатели (Рохит, Эндрю, Кев) из Принстона, Google DeepMind и UC Berkeley утверждают, что их маршрутизатор достигает производительности Claude Fable 5 вдвое дешевле.
Как это работает
Tokenless одновременно отправляет запрос нескольким моделям и отслеживает их прогресс. Как только одна модель явно на правильном пути, он отменяет остальные. Вы платите только за использование победившей модели. Техника нова: маршрутизатор запрашивает несколько моделей параллельно и использует их промежуточные результаты для принятия решения о маршрутизации. Команда также отмечает, что переключение моделей не уничтожает кэш, если алгоритм маршрутизации учитывает состояние горячего/холодного кэша.
Бенчмарки
На агентских бенчмарках τ³-Banking, Terminal-Bench 2.1 и DeepSWE 1.1 Tokenless Pro достигает 40,2% решаемости при $0,57/задача, против 24,5% и $3,32/задача у Claude Fable 5. Режим Ultra Saver маршрутизирует агрессивнее: 30,9% решаемости при $2,25/задача. Цифры представлены как «измеренные, не разрекламированные» — утверждается, что они превосходят все передовые модели по качеству с поправкой на стоимость.
Начало работы
Tokenless предоставляет совместимую с OpenAI и Anthropic конечную точку. Вы направляете существующего агента на их точку, а они занимаются маршрутизацией. Новые пользователи получают $20 бесплатного кредита. Команда планирует добавить Kimi K3, усилия GPT и другие модели.
Прогноз экономии
Tokenless предоставляет калькулятор: для команды, тратящей $40K/мес на LLM, прогнозируется новый счет в $26K/мес (экономия 34%, $14K/мес), всего $344K сэкономлено за следующий год при 11% ежемесячном росте расходов.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Когтевой Компактор: 14-ступенчатый движок сжатия токенов для конвейеров LLM
Claw Compactor — это движок сжатия токенов LLM с открытым исходным кодом, использующий 14-ступенчатый Fusion Pipeline для достижения среднего сжатия 54% без затрат на вывод LLM. Включает специализированные компрессоры для кода, JSON, логов, диффов и результатов поиска с возможностью обратимого сжатия.

Бруннфельдский Агентный Мир: МногоАгентная Симуляция Средневековой Экономики Без Поведенческих Подсказок
Симуляция на TypeScript, где 20 агентов LLM автономно торгуют в средневековой деревенской экономике без поведенческих инструкций, целей или торговых стратегий. Агенты получают около 200 токенов восприятия за каждый такт и взаимодействуют через детерминированный движок, обрабатывающий физику, рецепты и рыночную механику.

одноразовое чтение: Крючок Кода Клода, Предотвращающий Избыточное Чтение Файлов
Разработчик создал PreToolUse-хук под названием read-once, который отслеживает файлы, уже прочитанные Claude Code в сессии, блокируя повторное чтение неизмененных файлов и используя различия для измененных файлов. Этот инструмент экономит тысячи токенов за сессию, предотвращая многократное чтение Claude одного и того же содержимого файлов.

Расширение для браузера wearehere сканирует сайты на наличие отслеживания и угроз конфиденциальности.
wearehere — это расширение для браузера, которое сканирует веб-сайты по десяти категориям, включая куки, трекеры, снятие цифровых отпечатков устройств и тёмные паттерны, а затем оценивает их по уровню рисков для приватности. Оно весит менее 200 КБ, работает локально в браузере, а также доступно как npm-пакет для интеграции с ИИ-агентами через сервер barebrowse MCP.