EvalShift: CLI с открытым исходным кодом для обнаружения регрессий LLM при миграции моделей

✍️ OpenClawRadar📅 Опубликовано: 15 мая 2026 г.🔗 Source
EvalShift: CLI с открытым исходным кодом для обнаружения регрессий LLM при миграции моделей
Ad

EvalShift — это CLI-инструмент на Python с открытым исходным кодом, предназначенный для обнаружения регрессий при переходе между LLM или версиями моделей. Он запускает ваш набор эталонных запросов как на исходной, так и на целевой модели, оценивает результаты и создает локальный HTML-отчет — без серверной части, учетных записей или телеметрии.

Ключевые возможности

  • Сравнение исходной и целевой моделей через LiteLLM
  • Наборы эталонных запросов в формате JSONL с тегами/срезами
  • Структурные оценки: JSON-схема, регулярное выражение, длина
  • Семантическая оценка: сходство эмбеддингов
  • Попарная оценка LLM-судьей
  • Оценка вызовов инструментов: выбор инструмента, сопоставление аргументов, структура трассировки
  • Парные статистические тесты: t-тест / Вилкоксона
  • Размеры эффекта: Коэна d
  • Поправка на множественные сравнения: Бенджамини-Хохберга
  • Разбивка по срезам
  • Локальное кэширование для контроля затрат
  • Возобновляемые запуски
  • Однофайловый HTML-отчет + JSON-вывод

Узкая цель проекта — безопасность миграции: «Могу ли я переключиться между моделями, не нарушив поведение моих запросов/агентов?» Автор подчеркивает важность обнаружения скрытых регрессий агентов — например, когда более новая модель выдает вроде бы правильный итоговый ответ, но пропускает обязательный вызов инструмента, вызывает не тот инструмент или изменяет аргументы.

Ad

Варианты использования

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Локальная модель → облачная модель

Автор ищет отзывы о полезности инструмента для локальных и облачных моделей, о наиболее важных типах оценок для рабочих процессов локальных LLM, а также о том, являются ли регрессии вызовов инструментов / структурированного вывода реальной проблемой. Репозиторий распространяется под лицензией MIT.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Deblank: Инструмент для Удаления Форматирования Кода с Целью Сокращения Токенов для LLM
Инструменты

Deblank: Инструмент для Удаления Форматирования Кода с Целью Сокращения Токенов для LLM

Deblank — это инструмент с открытым исходным кодом, который удаляет форматирование кода (отступы, пробелы, переносы строк) перед отправкой в LLM, сокращая количество токенов примерно на 30% для Java/C++ и на 9% для Python с задержкой около 76 мс. Поддерживает Python, Java, C/C++, C#, JS/TS и Go.

OpenClawRadar
Сервер Kubeez MCP подключает Claude к более чем 70 медиа-моделям ИИ.
Инструменты

Сервер Kubeez MCP подключает Claude к более чем 70 медиа-моделям ИИ.

Kubeez выпустил MCP-сервер, который подключает Claude к более чем 70 AI-моделям для генерации изображений, видео, музыки и голоса. Сервер поддерживает аутентификацию OAuth и обеспечивает асинхронную генерацию, при которой Claude опрашивает статус и возвращает CDN-ссылки.

OpenClawRadar
Хеддл: Принудительное обеспечение доверия и ведение журнала аудита для подключений Claude Desktop MCP
Инструменты

Хеддл: Принудительное обеспечение доверия и ведение журнала аудита для подключений Claude Desktop MCP

Heddle — это инструмент с открытым исходным кодом, который добавляет уровни доверия, контроль доступа и журнал аудита к MCP-подключениям Claude Desktop, позволяя безопасно управлять несколькими сервисами через единый интерфейс с шестью стартовыми пакетами.

OpenClawRadar
Экранбокс: Открытый код виртуальных рабочих столов для ИИ-агентов, полностью созданных голосом
Инструменты

Экранбокс: Открытый код виртуальных рабочих столов для ИИ-агентов, полностью созданных голосом

Screenbox предоставляет изолированные Linux-рабочие столы в Docker для AI-агентов, решая конфликты при параллельном запуске нескольких агентов. Проект был полностью создан с помощью голосовых команд в Claude Code, и создатель не видел ни одной строки кода.

OpenClawRadar