GoModel: Легковесный шлюз искусственного интеллекта с открытым исходным кодом, написанный на Go

GoModel — это открытый шлюз искусственного интеллекта, написанный на Go, который располагается между вашим приложением и поставщиками моделей, такими как OpenAI, Anthropic, Gemini и другими. Он предоставляет унифицированный API-интерфейс, совместимый с OpenAI, при этом внутренне обрабатывая различия между провайдерами.
Ключевые особенности и отличия
Проект был создан для решения нескольких практических задач: отслеживание использования ИИ и затрат на клиента или команду, переключение моделей без изменения кода приложения, более простое отладка потоков запросов и сокращение расходов на ИИ с помощью точного и семантического кэширования.
Ключевые отличия от альтернатив:
- Образ Docker размером ~17 МБ (образ LiteLLM составляет ~746 МБ на amd64, что делает GoModel в 44 раза легче)
- Рабочий процесс запросов видим и легко проверяем
- Конфигурация по умолчанию в первую очередь основана на переменных окружения
Быстрый старт
Базовая развертывание с Docker:
docker run --rm -p 8080:8080 \
-e OPENAI_API_KEY="your-openai-key" \
enterpilot/gomodel
Для продакшена избегайте передачи секретов через командную строку и используйте:
docker run --env-file .env enterpilot/gomodel
Сделайте свой первый API-вызов:
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{ "model": "gpt-5-chat-latest", "messages": [{"role": "user", "content": "Hello!"}] }'
Поддерживаемые провайдеры
GoModel поддерживает несколько провайдеров LLM с автоматическим определением на основе предоставленных учетных данных:
- OpenAI (OPENAI_API_KEY)
- Anthropic (ANTHROPIC_API_KEY)
- Google Gemini (GEMINI_API_KEY)
- Groq (GROQ_API_KEY)
- OpenRouter (OPENROUTER_API_KEY)
- Z.ai (ZAI_API_KEY)
- xAI/Grok (XAI_API_KEY)
- Azure OpenAI (AZURE_API_KEY + AZURE_BASE_URL)
- Oracle (ORACLE_API_KEY + ORACLE_BASE_URL)
- Ollama (OLLAMA_BASE_URL)
Шлюз поддерживает чат-завершения, эмбеддинги, обработку файлов, пакетные операции и возможности сквозной передачи для большинства провайдеров. Для Oracle может потребоваться установить ORACLE_MODELS=openai.gpt-oss-120b,xai.grok-3, когда вышестоящая конечная точка /models недоступна.
Альтернативные методы настройки
Вы также можете запустить из исходного кода (требуется Go 1.26.2+) или использовать Docker Compose для инфраструктурных компонентов, включая Redis, PostgreSQL, MongoDB и Adminer.
Такой шлюз особенно полезен для команд, управляющих несколькими моделями ИИ от разных провайдеров, нуждающихся в отслеживании затрат или желающих сохранить гибкость для переключения провайдеров без изменения кода. Легковесный образ Docker делает его подходящим для сред с ограниченными ресурсами.
📖 Read the full source: HN LLM Tools
👀 Смотрите также

Плагин Swarm Orchestra v2 добавляет меж-агентный обмен сообщениями для устранения хаоса в команде кодовых агентов Claude.
Swarm Orchestra — это плагин, который решает проблемы с экспериментальной функцией TeamCreate в Claude Code, способной порождать неуправляемых агентов. Версия 2 добавляет обмен сообщениями между агентами через хук PreToolUse и самонастройку с помощью навыка /teammate.

Пользователь OpenClaw критикует архитектуру инструмента и пробелы в безопасности.
Пользователь Reddit описывает OpenClaw как единственный инструмент, делающий автоматизацию агентов настолько доступной, но критикует его архитектуру за отсутствие контрольного слоя для файловых операций, защищённого ядра, надлежащего управления контекстом, а также встроенного контроля версий или тестов.

Приложение Hyper iOS: Диктофон с транскрипцией в реальном времени и извлечением действий
Hyper — это голосовой диктофон для iOS, который транскрибирует разговоры в реальном времени, предоставляет сводки и задачи, а также позволяет задавать вопросы во время беседы с помощью обнаружения ключевого слова. Он предназначен для неструктурированных встреч, таких как личные беседы, кофе-брейки и стендапы.

Плагин Spectyra для OpenClaw: оптимизация затрат на ИИ в реальном времени за счет анализа полного потока запросов
Плагин Spectyra снижает затраты на AI API, выявляя в реальном времени скрытые потери, такие как повторные вызовы, избыточный контекст и неправильное использование дорогих моделей.