EvalShift: CLI с открытым исходным кодом для обнаружения регрессий LLM при миграции моделей

EvalShift — это CLI-инструмент на Python с открытым исходным кодом, предназначенный для обнаружения регрессий при переходе между LLM или версиями моделей. Он запускает ваш набор эталонных запросов как на исходной, так и на целевой модели, оценивает результаты и создает локальный HTML-отчет — без серверной части, учетных записей или телеметрии.
Ключевые возможности
- Сравнение исходной и целевой моделей через LiteLLM
- Наборы эталонных запросов в формате JSONL с тегами/срезами
- Структурные оценки: JSON-схема, регулярное выражение, длина
- Семантическая оценка: сходство эмбеддингов
- Попарная оценка LLM-судьей
- Оценка вызовов инструментов: выбор инструмента, сопоставление аргументов, структура трассировки
- Парные статистические тесты: t-тест / Вилкоксона
- Размеры эффекта: Коэна d
- Поправка на множественные сравнения: Бенджамини-Хохберга
- Разбивка по срезам
- Локальное кэширование для контроля затрат
- Возобновляемые запуски
- Однофайловый HTML-отчет + JSON-вывод
Узкая цель проекта — безопасность миграции: «Могу ли я переключиться между моделями, не нарушив поведение моих запросов/агентов?» Автор подчеркивает важность обнаружения скрытых регрессий агентов — например, когда более новая модель выдает вроде бы правильный итоговый ответ, но пропускает обязательный вызов инструмента, вызывает не тот инструмент или изменяет аргументы.
Варианты использования
- Claude 4.5 → Claude 5
- GPT-5 → GPT-6
- Gemini 2 → 3
- Локальная модель → облачная модель
Автор ищет отзывы о полезности инструмента для локальных и облачных моделей, о наиболее важных типах оценок для рабочих процессов локальных LLM, а также о том, являются ли регрессии вызовов инструментов / структурированного вывода реальной проблемой. Репозиторий распространяется под лицензией MIT.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Deblank: Инструмент для Удаления Форматирования Кода с Целью Сокращения Токенов для LLM
Deblank — это инструмент с открытым исходным кодом, который удаляет форматирование кода (отступы, пробелы, переносы строк) перед отправкой в LLM, сокращая количество токенов примерно на 30% для Java/C++ и на 9% для Python с задержкой около 76 мс. Поддерживает Python, Java, C/C++, C#, JS/TS и Go.

Сервер Kubeez MCP подключает Claude к более чем 70 медиа-моделям ИИ.
Kubeez выпустил MCP-сервер, который подключает Claude к более чем 70 AI-моделям для генерации изображений, видео, музыки и голоса. Сервер поддерживает аутентификацию OAuth и обеспечивает асинхронную генерацию, при которой Claude опрашивает статус и возвращает CDN-ссылки.

Хеддл: Принудительное обеспечение доверия и ведение журнала аудита для подключений Claude Desktop MCP
Heddle — это инструмент с открытым исходным кодом, который добавляет уровни доверия, контроль доступа и журнал аудита к MCP-подключениям Claude Desktop, позволяя безопасно управлять несколькими сервисами через единый интерфейс с шестью стартовыми пакетами.

Экранбокс: Открытый код виртуальных рабочих столов для ИИ-агентов, полностью созданных голосом
Screenbox предоставляет изолированные Linux-рабочие столы в Docker для AI-агентов, решая конфликты при параллельном запуске нескольких агентов. Проект был полностью создан с помощью голосовых команд в Claude Code, и создатель не видел ни одной строки кода.