EvalShift: CLI с открытым исходным кодом для обнаружения регрессий LLM при миграции моделей

✍️ OpenClawRadar📅 Опубликовано: 15 мая 2026 г.🔗 Source
EvalShift: CLI с открытым исходным кодом для обнаружения регрессий LLM при миграции моделей
Ad

EvalShift — это CLI-инструмент на Python с открытым исходным кодом, предназначенный для обнаружения регрессий при переходе между LLM или версиями моделей. Он запускает ваш набор эталонных запросов как на исходной, так и на целевой модели, оценивает результаты и создает локальный HTML-отчет — без серверной части, учетных записей или телеметрии.

Ключевые возможности

  • Сравнение исходной и целевой моделей через LiteLLM
  • Наборы эталонных запросов в формате JSONL с тегами/срезами
  • Структурные оценки: JSON-схема, регулярное выражение, длина
  • Семантическая оценка: сходство эмбеддингов
  • Попарная оценка LLM-судьей
  • Оценка вызовов инструментов: выбор инструмента, сопоставление аргументов, структура трассировки
  • Парные статистические тесты: t-тест / Вилкоксона
  • Размеры эффекта: Коэна d
  • Поправка на множественные сравнения: Бенджамини-Хохберга
  • Разбивка по срезам
  • Локальное кэширование для контроля затрат
  • Возобновляемые запуски
  • Однофайловый HTML-отчет + JSON-вывод

Узкая цель проекта — безопасность миграции: «Могу ли я переключиться между моделями, не нарушив поведение моих запросов/агентов?» Автор подчеркивает важность обнаружения скрытых регрессий агентов — например, когда более новая модель выдает вроде бы правильный итоговый ответ, но пропускает обязательный вызов инструмента, вызывает не тот инструмент или изменяет аргументы.

Ad

Варианты использования

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Локальная модель → облачная модель

Автор ищет отзывы о полезности инструмента для локальных и облачных моделей, о наиболее важных типах оценок для рабочих процессов локальных LLM, а также о том, являются ли регрессии вызовов инструментов / структурированного вывода реальной проблемой. Репозиторий распространяется под лицензией MIT.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Почему один инструмент run() с командами Unix превосходит вызов функций для AI-агентов
Инструменты

Почему один инструмент run() с командами Unix превосходит вызов функций для AI-агентов

Ведущий backend-разработчик с двухлетним опытом создания агентов утверждает, что единый инструмент run(command="...") с командами в стиле Unix превосходит традиционные каталоги вызова функций. Этот подход использует существующую в LLM знакомство с командами оболочки из обучающих данных.

OpenClawRadar
Панель управления Silos: Веб-интерфейс с открытым исходным кодом для управления агентами OpenClaw
Инструменты

Панель управления Silos: Веб-интерфейс с открытым исходным кодом для управления агентами OpenClaw

Silos Dashboard — это веб-интерфейс с лицензией MIT для управления агентами OpenClaw, заменяющий конфигурационные файлы и CLI единым интерфейсом. Он предлагает управление агентами, живой чат с потоковой передачей, установку навыков, доски задач, интеграцию каналов и аналитику.

OpenClawRadar
Инструмент AI-Setup CLI автоматически генерирует конфигурационные файлы ИИ для локальных стеков LLM.
Инструменты

Инструмент AI-Setup CLI автоматически генерирует конфигурационные файлы ИИ для локальных стеков LLM.

AI-Setup — это CLI-инструмент, который сканирует кодовые базы и автоматически генерирует конфигурационные файлы для ИИ, такие как .cursorrules и claude.md. Он определяет ваш стек технологий, чтобы исключить ручное написание правил для каждого нового проекта.

OpenClawRadar
Homelab AI Sentinel: Самостоятельно размещаемый помощник для мониторинга с интеграцией LLM
Инструменты

Homelab AI Sentinel: Самостоятельно размещаемый помощник для мониторинга с интеграцией LLM

Homelab AI Sentinel — это саморазмещаемый инструмент, который обрабатывает мониторинговые вебхуки через LLM для генерации диагнозов на простом английском языке. Он поддерживает 11 источников оповещений, 10 платформ уведомлений и работает с любыми OpenAI-совместимыми конечными точками, включая Ollama и LM Studio для локального вывода.

OpenClawRadar