EvalShift : CLI open source pour détecter les régressions LLM lors de la migration de modèle

EvalShift est un CLI Python open-source conçu pour détecter les régressions lors du changement entre LLM ou versions de modèles. Il exécute votre suite d'entrées dorées sur les modèles source et cible, évalue les sorties et produit un rapport HTML local — sans backend, comptes ni télémétrie.
Fonctionnalités clés
- Comparaison modèle source vs cible via LiteLLM
- Suites dorées JSONL avec tags/tranches
- Évaluateurs structurels : schéma JSON, regex, longueur
- Évaluateur sémantique : similarité d'embedding
- Évaluation par paire LLM-as-judge
- Évaluateurs d'appels d'outils : sélection d'outil, correspondance d'arguments, structure de trace
- Tests statistiques appariés : t-test / Wilcoxon
- Tailles d'effet : d de Cohen
- Correction pour comparaisons multiples : Benjamini-Hochberg
- Répartitions par tranche
- Cache local pour maîtriser les coûts
- Exécutions reprenables
- Rapport HTML fichier unique + sortie JSON
L'objectif étroit du projet est la sécurité de migration : « Puis-je changer de modèle sans casser le comportement de mon invite/agent ? » L'auteur insiste sur la détection des régressions silencieuses d'agents — par exemple, un modèle plus récent produisant une réponse finale acceptable mais sautant un appel d'outil nécessaire, appelant le mauvais outil ou modifiant des arguments.
Cas d'utilisation
- Claude 4.5 → Claude 5
- GPT-5 → GPT-6
- Gemini 2 → 3
- Modèle local → modèle hébergé
L'auteur recherche des retours sur l'utilité pour les modèles locaux vs hébergés, les types d'évaluateurs les plus importants pour les workflows LLM locaux, et si les régressions d'appels d'outils/sorties structurées sont un véritable point sensible. Le dépôt est sous licence MIT.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Répertoire des serveurs MCP répertorie plus de 1000 serveurs répartis dans 20 catégories
Un répertoire organisé fournit des commandes d'installation et des extraits de configuration pour plus de 1000 serveurs MCP, couvrant des catégories telles que les bases de données, les outils de développement, l'automatisation de navigateur, l'IA/ML et le cloud/devops. Le répertoire est gratuit à consulter et à soumettre.

Claude Opus 4.6 : Un modèle pour les tâches d'ingénierie soutenues
Claude Opus 4.6 apporte une concentration soutenue aux projets à long terme, prenant en charge les tâches de plusieurs jours avec des fonctionnalités comme un contexte ultra-long et une réflexion adaptative.

BotCost.dev : Analyseur gratuit pour voir combien coûtent les bots IA à votre site
BotCost.dev est un outil gratuit qui analyse vos journaux serveur par rapport à 18 empreintes de bots d'IA connus (GPTBot, ClaudeBot, Perplexity, etc.) et estime le coût mensuel de bande passante — aucun téléchargement requis, tout s'exécute dans le navigateur.

antirez's DS4 : Exécuter DeepSeek V4 Flash avec 1M de contexte sur Mac Metal et DGX
Le créateur de Redis, Salvatore Sanfilippo, a publié DS4, un projet pour exécuter DeepSeek V4 Flash avec une fenêtre de contexte de 1M sur du matériel Mac Metal et DGX, avec des points de terminaison OpenAI/Anthropic pour les outils de codage agentiques.