EvalShift: CLI с открытым исходным кодом для обнаружения регрессий LLM при миграции моделей

EvalShift — это CLI-инструмент на Python с открытым исходным кодом, предназначенный для обнаружения регрессий при переходе между LLM или версиями моделей. Он запускает ваш набор эталонных запросов как на исходной, так и на целевой модели, оценивает результаты и создает локальный HTML-отчет — без серверной части, учетных записей или телеметрии.
Ключевые возможности
- Сравнение исходной и целевой моделей через LiteLLM
- Наборы эталонных запросов в формате JSONL с тегами/срезами
- Структурные оценки: JSON-схема, регулярное выражение, длина
- Семантическая оценка: сходство эмбеддингов
- Попарная оценка LLM-судьей
- Оценка вызовов инструментов: выбор инструмента, сопоставление аргументов, структура трассировки
- Парные статистические тесты: t-тест / Вилкоксона
- Размеры эффекта: Коэна d
- Поправка на множественные сравнения: Бенджамини-Хохберга
- Разбивка по срезам
- Локальное кэширование для контроля затрат
- Возобновляемые запуски
- Однофайловый HTML-отчет + JSON-вывод
Узкая цель проекта — безопасность миграции: «Могу ли я переключиться между моделями, не нарушив поведение моих запросов/агентов?» Автор подчеркивает важность обнаружения скрытых регрессий агентов — например, когда более новая модель выдает вроде бы правильный итоговый ответ, но пропускает обязательный вызов инструмента, вызывает не тот инструмент или изменяет аргументы.
Варианты использования
- Claude 4.5 → Claude 5
- GPT-5 → GPT-6
- Gemini 2 → 3
- Локальная модель → облачная модель
Автор ищет отзывы о полезности инструмента для локальных и облачных моделей, о наиболее важных типах оценок для рабочих процессов локальных LLM, а также о том, являются ли регрессии вызовов инструментов / структурированного вывода реальной проблемой. Репозиторий распространяется под лицензией MIT.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Почему один инструмент run() с командами Unix превосходит вызов функций для AI-агентов
Ведущий backend-разработчик с двухлетним опытом создания агентов утверждает, что единый инструмент run(command="...") с командами в стиле Unix превосходит традиционные каталоги вызова функций. Этот подход использует существующую в LLM знакомство с командами оболочки из обучающих данных.

Панель управления Silos: Веб-интерфейс с открытым исходным кодом для управления агентами OpenClaw
Silos Dashboard — это веб-интерфейс с лицензией MIT для управления агентами OpenClaw, заменяющий конфигурационные файлы и CLI единым интерфейсом. Он предлагает управление агентами, живой чат с потоковой передачей, установку навыков, доски задач, интеграцию каналов и аналитику.

Инструмент AI-Setup CLI автоматически генерирует конфигурационные файлы ИИ для локальных стеков LLM.
AI-Setup — это CLI-инструмент, который сканирует кодовые базы и автоматически генерирует конфигурационные файлы для ИИ, такие как .cursorrules и claude.md. Он определяет ваш стек технологий, чтобы исключить ручное написание правил для каждого нового проекта.

Homelab AI Sentinel: Самостоятельно размещаемый помощник для мониторинга с интеграцией LLM
Homelab AI Sentinel — это саморазмещаемый инструмент, который обрабатывает мониторинговые вебхуки через LLM для генерации диагнозов на простом английском языке. Он поддерживает 11 источников оповещений, 10 платформ уведомлений и работает с любыми OpenAI-совместимыми конечными точками, включая Ollama и LM Studio для локального вывода.