Bifrost LLM Gateway: 11 микросекунд накладных расходов, единый бинарный файл на Go

Что такое Bifrost
Bifrost — это готовый прокси для LLM, написанный на Go, специально для саморазмещаемых сред. Он маршрутизирует запросы к OpenAI, Anthropic, Azure, Bedrock и другим провайдерам, одновременно обрабатывая отказоустойчивость, кэширование и контроль бюджета.
Тесты производительности
Разработчик провёл тестирование с устойчивой нагрузкой в 5 000 запросов в секунду:
- Bifrost (Go): ~11 микросекунд накладных расходов на запрос
- LiteLLM (Python): ~8 миллисекунд накладных расходов на запрос
Это примерно в 700 раз меньше накладных расходов.
Сравнение использования памяти
При той же пропускной способности:
- Bifrost: ~50 МБ ОЗУ в базовом режиме, остаётся стабильным под нагрузкой
- LiteLLM: ~300-400 МБ ОЗУ в базовом режиме, скачки до 800+ МБ при высокой нагрузке
Разработчик отмечает, что для работы LiteLLM при 2k+ RPS требуется горизонтальное масштабирование и серьёзные размеры инстансов, в то время как Bifrost обрабатывает 5k RPS на VPS за $20 в месяц.
Стабильность под нагрузкой
Производительность Bifrost остаётся постоянной под нагрузкой с одинаковой задержкой как при 100 RPS, так и при 5 000 RPS. В отличие от этого, LiteLLM становится непредсказуемым при скачках трафика — увеличивается вариативность задержек, возникают скачки памяти, а паузы сборки мусора происходят в самые неподходящие моменты.
Уникальные возможности
Bifrost включает шлюз MCP, который подключает 10+ серверов инструментов MCP, обрабатывает обнаружение, пространства имён, проверки работоспособности и фильтрацию инструментов для каждого запроса. LiteLLM не поддерживает MCP.
Развёртывание и миграция
Развёртывание представляет собой один бинарный файл без виртуальных окружений Python, без проблем с зависимостями и без необходимости в Docker. Вы просто копируете его на сервер и запускаете.
Для миграции API совместим с OpenAI. Вы меняете базовый URL и сохраняете существующий код, при этом большинство миграций занимает менее часа.
Доступность в открытом исходном коде
Проект имеет открытый исходный код и доступен на github.com/maximhq/bifrost.
📖 Read the full source: r/clawdbot
👀 Смотрите также

AgentRoom: Десктопное приложение визуализирует ИИ-агентов для программирования в виде пиксельных персонажей с возможностью поиска сессий.
AgentRoom — это десктопное приложение, которое превращает сессии Claude Code, Codex и Gemini в анимированных пиксельных персонажей в виртуальном офисе, с полнотекстовым семантическим поиском по всем сессиям. Репозиторий включает автономный навык Claude Code для поиска прошлых сессий из любого диалога.

Движок вывода Bodega: Оптимизация вывода LLM для унифицированной памяти Apple Silicon
Bodega — это механизм вывода, созданный специально для единой архитектуры памяти Apple Silicon, который решает проблемы пропускной способности за счёт перепроектирования непрерывного пакетирования и управления кэшем KV для MLX. Разработчик сообщает, что работал над ним 2,5 года с оптимизациями, близкими к уровню Metal.

Фабрика агентов: Плагин Claude Code для создания постоянных команд AI-субагентов
Agent-factory — это плагин Claude Code, который создает постоянные команды под-агентов с различными личностями и файловой памятью. Он формирует 2-5 агентов на проект через диалоговое интервью, где каждый агент выполняет определенные роли, такие как ревью кода, отслеживание технического долга или стратегия.

Локально-облачная гибридная архитектура ИИ: практические паттерны, вдохновленные r/LocalLLaMA
В исходном посте предлагается гибридная модель ИИ, где локальная модель обрабатывает рутинные задачи и передает сложные рассуждения облачной модели через один вызов API, а также детерминированный «гипервизор» для ограничений безопасности.