Bifrost LLM Gateway: 11 микросекунд накладных расходов, единый бинарный файл на Go

✍️ OpenClawRadar📅 Опубликовано: 27 февраля 2026 г.🔗 Source
Bifrost LLM Gateway: 11 микросекунд накладных расходов, единый бинарный файл на Go
Ad

Что такое Bifrost

Bifrost — это готовый прокси для LLM, написанный на Go, специально для саморазмещаемых сред. Он маршрутизирует запросы к OpenAI, Anthropic, Azure, Bedrock и другим провайдерам, одновременно обрабатывая отказоустойчивость, кэширование и контроль бюджета.

Тесты производительности

Разработчик провёл тестирование с устойчивой нагрузкой в 5 000 запросов в секунду:

  • Bifrost (Go): ~11 микросекунд накладных расходов на запрос
  • LiteLLM (Python): ~8 миллисекунд накладных расходов на запрос

Это примерно в 700 раз меньше накладных расходов.

Сравнение использования памяти

При той же пропускной способности:

  • Bifrost: ~50 МБ ОЗУ в базовом режиме, остаётся стабильным под нагрузкой
  • LiteLLM: ~300-400 МБ ОЗУ в базовом режиме, скачки до 800+ МБ при высокой нагрузке

Разработчик отмечает, что для работы LiteLLM при 2k+ RPS требуется горизонтальное масштабирование и серьёзные размеры инстансов, в то время как Bifrost обрабатывает 5k RPS на VPS за $20 в месяц.

Ad

Стабильность под нагрузкой

Производительность Bifrost остаётся постоянной под нагрузкой с одинаковой задержкой как при 100 RPS, так и при 5 000 RPS. В отличие от этого, LiteLLM становится непредсказуемым при скачках трафика — увеличивается вариативность задержек, возникают скачки памяти, а паузы сборки мусора происходят в самые неподходящие моменты.

Уникальные возможности

Bifrost включает шлюз MCP, который подключает 10+ серверов инструментов MCP, обрабатывает обнаружение, пространства имён, проверки работоспособности и фильтрацию инструментов для каждого запроса. LiteLLM не поддерживает MCP.

Развёртывание и миграция

Развёртывание представляет собой один бинарный файл без виртуальных окружений Python, без проблем с зависимостями и без необходимости в Docker. Вы просто копируете его на сервер и запускаете.

Для миграции API совместим с OpenAI. Вы меняете базовый URL и сохраняете существующий код, при этом большинство миграций занимает менее часа.

Доступность в открытом исходном коде

Проект имеет открытый исходный код и доступен на github.com/maximhq/bifrost.

📖 Read the full source: r/clawdbot

Ad

👀 Смотрите также

AgentRoom: Десктопное приложение визуализирует ИИ-агентов для программирования в виде пиксельных персонажей с возможностью поиска сессий.
Инструменты

AgentRoom: Десктопное приложение визуализирует ИИ-агентов для программирования в виде пиксельных персонажей с возможностью поиска сессий.

AgentRoom — это десктопное приложение, которое превращает сессии Claude Code, Codex и Gemini в анимированных пиксельных персонажей в виртуальном офисе, с полнотекстовым семантическим поиском по всем сессиям. Репозиторий включает автономный навык Claude Code для поиска прошлых сессий из любого диалога.

OpenClawRadar
Движок вывода Bodega: Оптимизация вывода LLM для унифицированной памяти Apple Silicon
Инструменты

Движок вывода Bodega: Оптимизация вывода LLM для унифицированной памяти Apple Silicon

Bodega — это механизм вывода, созданный специально для единой архитектуры памяти Apple Silicon, который решает проблемы пропускной способности за счёт перепроектирования непрерывного пакетирования и управления кэшем KV для MLX. Разработчик сообщает, что работал над ним 2,5 года с оптимизациями, близкими к уровню Metal.

OpenClawRadar
Фабрика агентов: Плагин Claude Code для создания постоянных команд AI-субагентов
Инструменты

Фабрика агентов: Плагин Claude Code для создания постоянных команд AI-субагентов

Agent-factory — это плагин Claude Code, который создает постоянные команды под-агентов с различными личностями и файловой памятью. Он формирует 2-5 агентов на проект через диалоговое интервью, где каждый агент выполняет определенные роли, такие как ревью кода, отслеживание технического долга или стратегия.

OpenClawRadar
Локально-облачная гибридная архитектура ИИ: практические паттерны, вдохновленные r/LocalLLaMA
Инструменты

Локально-облачная гибридная архитектура ИИ: практические паттерны, вдохновленные r/LocalLLaMA

В исходном посте предлагается гибридная модель ИИ, где локальная модель обрабатывает рутинные задачи и передает сложные рассуждения облачной модели через один вызов API, а также детерминированный «гипервизор» для ограничений безопасности.

OpenClawRadar