Безтоковый API-шлюз маршрутизирует ИИ-трафик между моделями, сокращая расходы вдвое
Tokenless (YC S26) — это подключаемый API-шлюз, который сокращает расходы на AI-инференс, направляя каждый шаг диалога агента на самую дешевую адекватную модель. Основатели (Рохит, Эндрю, Кев) из Принстона, Google DeepMind и UC Berkeley утверждают, что их маршрутизатор достигает производительности Claude Fable 5 вдвое дешевле.
Как это работает
Tokenless одновременно отправляет запрос нескольким моделям и отслеживает их прогресс. Как только одна модель явно на правильном пути, он отменяет остальные. Вы платите только за использование победившей модели. Техника нова: маршрутизатор запрашивает несколько моделей параллельно и использует их промежуточные результаты для принятия решения о маршрутизации. Команда также отмечает, что переключение моделей не уничтожает кэш, если алгоритм маршрутизации учитывает состояние горячего/холодного кэша.
Бенчмарки
На агентских бенчмарках τ³-Banking, Terminal-Bench 2.1 и DeepSWE 1.1 Tokenless Pro достигает 40,2% решаемости при $0,57/задача, против 24,5% и $3,32/задача у Claude Fable 5. Режим Ultra Saver маршрутизирует агрессивнее: 30,9% решаемости при $2,25/задача. Цифры представлены как «измеренные, не разрекламированные» — утверждается, что они превосходят все передовые модели по качеству с поправкой на стоимость.
Начало работы
Tokenless предоставляет совместимую с OpenAI и Anthropic конечную точку. Вы направляете существующего агента на их точку, а они занимаются маршрутизацией. Новые пользователи получают $20 бесплатного кредита. Команда планирует добавить Kimi K3, усилия GPT и другие модели.
Прогноз экономии
Tokenless предоставляет калькулятор: для команды, тратящей $40K/мес на LLM, прогнозируется новый счет в $26K/мес (экономия 34%, $14K/мес), всего $344K сэкономлено за следующий год при 11% ежемесячном росте расходов.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Специалист по открытому исходному коду Dispatch Adapter делегирует сложные задачи Claude Code.
expert-dispatch — это bash-скрипт объёмом около 500 строк, который позволяет недорогому ИИ-ассистенту делегировать сложные задачи по программированию в Claude Code CLI. Он использует команды вроде dispatch-cc run для отправки заданий и поддерживает отдельные директории для каждого проекта с файлом CLAUDE.md для сохранения контекста.

Платформа ИИ Cloudflare: Единый уровень вывода для ИИ-агентов
AI-платформа Cloudflare предоставляет единый API для доступа к более чем 70 моделям от 12+ провайдеров, включая мультимодальную поддержку для изображений, видео и речевых моделей. Она позволяет переключаться между моделями изменением одной строки кода и предлагает централизованный мониторинг затрат с пользовательскими метаданными.

Навык OpenClaw связывает агентов с интерфейсом Knods.io для создания рабочих процессов.
Разработчик создал навык OpenClaw, который позволяет агентам понимать и создавать рабочие процессы в интерфейсе Knods.io, давая пользователям возможность переключаться между конкретными агентами, например, брендовыми, вместо использования встроенного агента Knods.

Revdiff: Терминальный просмотрщик различий со встроенными аннотациями для AI-агентов
Revdiff — это TUI-инструмент для просмотра различий, созданный специально для проверки изменений в коде, сгенерированных ИИ, без выхода из терминальных сессий. Он выводит структурированные аннотации в stdout, которые можно напрямую передавать обратно ИИ-агентам, таким как Claude Code, создавая непрерывный цикл проверки.