EvalShift : CLI open source pour détecter les régressions LLM lors de la migration de modèle

✍️ OpenClawRadar📅 Publié: May 15, 2026🔗 Source
EvalShift : CLI open source pour détecter les régressions LLM lors de la migration de modèle
Ad

EvalShift est un CLI Python open-source conçu pour détecter les régressions lors du changement entre LLM ou versions de modèles. Il exécute votre suite d'entrées dorées sur les modèles source et cible, évalue les sorties et produit un rapport HTML local — sans backend, comptes ni télémétrie.

Fonctionnalités clés

  • Comparaison modèle source vs cible via LiteLLM
  • Suites dorées JSONL avec tags/tranches
  • Évaluateurs structurels : schéma JSON, regex, longueur
  • Évaluateur sémantique : similarité d'embedding
  • Évaluation par paire LLM-as-judge
  • Évaluateurs d'appels d'outils : sélection d'outil, correspondance d'arguments, structure de trace
  • Tests statistiques appariés : t-test / Wilcoxon
  • Tailles d'effet : d de Cohen
  • Correction pour comparaisons multiples : Benjamini-Hochberg
  • Répartitions par tranche
  • Cache local pour maîtriser les coûts
  • Exécutions reprenables
  • Rapport HTML fichier unique + sortie JSON

L'objectif étroit du projet est la sécurité de migration : « Puis-je changer de modèle sans casser le comportement de mon invite/agent ? » L'auteur insiste sur la détection des régressions silencieuses d'agents — par exemple, un modèle plus récent produisant une réponse finale acceptable mais sautant un appel d'outil nécessaire, appelant le mauvais outil ou modifiant des arguments.

Ad

Cas d'utilisation

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Modèle local → modèle hébergé

L'auteur recherche des retours sur l'utilité pour les modèles locaux vs hébergés, les types d'évaluateurs les plus importants pour les workflows LLM locaux, et si les régressions d'appels d'outils/sorties structurées sont un véritable point sensible. Le dépôt est sous licence MIT.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Répertoire des serveurs MCP répertorie plus de 1000 serveurs répartis dans 20 catégories
Tools

Répertoire des serveurs MCP répertorie plus de 1000 serveurs répartis dans 20 catégories

Un répertoire organisé fournit des commandes d'installation et des extraits de configuration pour plus de 1000 serveurs MCP, couvrant des catégories telles que les bases de données, les outils de développement, l'automatisation de navigateur, l'IA/ML et le cloud/devops. Le répertoire est gratuit à consulter et à soumettre.

OpenClawRadar
Claude Opus 4.6 : Un modèle pour les tâches d'ingénierie soutenues
Tools

Claude Opus 4.6 : Un modèle pour les tâches d'ingénierie soutenues

Claude Opus 4.6 apporte une concentration soutenue aux projets à long terme, prenant en charge les tâches de plusieurs jours avec des fonctionnalités comme un contexte ultra-long et une réflexion adaptative.

OpenClawRadar
BotCost.dev : Analyseur gratuit pour voir combien coûtent les bots IA à votre site
Tools

BotCost.dev : Analyseur gratuit pour voir combien coûtent les bots IA à votre site

BotCost.dev est un outil gratuit qui analyse vos journaux serveur par rapport à 18 empreintes de bots d'IA connus (GPTBot, ClaudeBot, Perplexity, etc.) et estime le coût mensuel de bande passante — aucun téléchargement requis, tout s'exécute dans le navigateur.

OpenClawRadar
antirez's DS4 : Exécuter DeepSeek V4 Flash avec 1M de contexte sur Mac Metal et DGX
Tools

antirez's DS4 : Exécuter DeepSeek V4 Flash avec 1M de contexte sur Mac Metal et DGX

Le créateur de Redis, Salvatore Sanfilippo, a publié DS4, un projet pour exécuter DeepSeek V4 Flash avec une fenêtre de contexte de 1M sur du matériel Mac Metal et DGX, avec des points de terminaison OpenAI/Anthropic pour les outils de codage agentiques.

OpenClawRadar