EvalShift : CLI open source pour détecter les régressions LLM lors de la migration de modèle

✍️ OpenClawRadar📅 Publié: May 15, 2026🔗 Source
EvalShift : CLI open source pour détecter les régressions LLM lors de la migration de modèle
Ad

EvalShift est un CLI Python open-source conçu pour détecter les régressions lors du changement entre LLM ou versions de modèles. Il exécute votre suite d'entrées dorées sur les modèles source et cible, évalue les sorties et produit un rapport HTML local — sans backend, comptes ni télémétrie.

Fonctionnalités clés

  • Comparaison modèle source vs cible via LiteLLM
  • Suites dorées JSONL avec tags/tranches
  • Évaluateurs structurels : schéma JSON, regex, longueur
  • Évaluateur sémantique : similarité d'embedding
  • Évaluation par paire LLM-as-judge
  • Évaluateurs d'appels d'outils : sélection d'outil, correspondance d'arguments, structure de trace
  • Tests statistiques appariés : t-test / Wilcoxon
  • Tailles d'effet : d de Cohen
  • Correction pour comparaisons multiples : Benjamini-Hochberg
  • Répartitions par tranche
  • Cache local pour maîtriser les coûts
  • Exécutions reprenables
  • Rapport HTML fichier unique + sortie JSON

L'objectif étroit du projet est la sécurité de migration : « Puis-je changer de modèle sans casser le comportement de mon invite/agent ? » L'auteur insiste sur la détection des régressions silencieuses d'agents — par exemple, un modèle plus récent produisant une réponse finale acceptable mais sautant un appel d'outil nécessaire, appelant le mauvais outil ou modifiant des arguments.

Ad

Cas d'utilisation

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Modèle local → modèle hébergé

L'auteur recherche des retours sur l'utilité pour les modèles locaux vs hébergés, les types d'évaluateurs les plus importants pour les workflows LLM locaux, et si les régressions d'appels d'outils/sorties structurées sont un véritable point sensible. Le dépôt est sous licence MIT.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Agent d'IA local atteint une latence STT et TTS inférieure à la seconde avec des serveurs open source
Tools

Agent d'IA local atteint une latence STT et TTS inférieure à la seconde avec des serveurs open source

Un développeur a atteint une latence de ~0,2 s pour la reconnaissance vocale (STT) en utilisant Whisper large-v3-turbo avec une architecture hybride de threads gérés par GPU, et une latence de ~250 ms pour la synthèse vocale (TTS) avec Coqui-TTS optimisé pour une synthèse à faible latence. Les deux implémentations sont entièrement auto-hébergées et open source.

OpenClawRadar
Application de la Barre d'État Windows pour la Surveillance en Temps Réel de l'Utilisation de l'API Claude
Tools

Application de la Barre d'État Windows pour la Surveillance en Temps Réel de l'Utilisation de l'API Claude

Un développeur a créé une application légère pour la barre d'état système Windows qui affiche en temps réel l'utilisation du quota de l'API Claude, incluant les fenêtres de 5 heures et 7 jours, les comptes de tokens du jour et les prévisions d'épuisement. L'application prend en charge les interfaces utilisateur en coréen, anglais, chinois et japonais et est open source sur GitHub.

OpenClawRadar
CodeVibe : Notifications push pour les agents d'IA de codage lorsqu'ils sont bloqués sur une entrée
Tools

CodeVibe : Notifications push pour les agents d'IA de codage lorsqu'ils sont bloqués sur une entrée

CodeVibe envoie des notifications push sur votre téléphone lorsque des agents d'IA de codage comme Claude Code se retrouvent bloqués en attente d'approbation pour des opérations de modification. Vous pouvez examiner les différences de fichiers et répondre avec des options numérotées pour permettre à l'agent de continuer.

OpenClawRadar
LLAB Noir : Architecture Open-Source pour le Routage Dynamique de Modèles et les Agents IA en Sandbox Docker
Tools

LLAB Noir : Architecture Open-Source pour le Routage Dynamique de Modèles et les Agents IA en Sandbox Docker

Un développeur a open-sourcé Black LLAB, un système qui utilise Mistral 3B pour router les prompts entre des modèles locaux et cloud et exécute des agents d'IA dans des conteneurs Docker isolés avec intégration OpenClaw.

OpenClawRadar