EvalShift: Open-Source-CLI zur Erkennung von LLM-Regressionen bei der Modellmigration

EvalShift ist ein quelloffenes Python-CLI, das entwickelt wurde, um Regressionen beim Wechsel zwischen LLMs oder Modellversionen zu erkennen. Es führt Ihre goldenen Inputsuiten sowohl gegen das Quell- als auch das Zielmodell aus, bewertet die Ausgaben und erstellt einen lokalen HTML-Bericht – ohne Backend, Konten oder Telemetrie.
Hauptfunktionen
- Vergleich von Quell- und Zielmodell über LiteLLM
- JSONL-Gold-Suiten mit Tags/Slices
- Strukturelle Evaluatoren: JSON-Schema, Regex, Länge
- Semantischer Evaluator: Embedding-Ähnlichkeit
- LLM-als-Richter Paarvergleich
- Tool-Call-Evaluatoren: Tool-Auswahl, Argumentabgleich, Ablaufstruktur
- Gepaarte statistische Tests: t-Test / Wilcoxon
- Effektstärken: Cohens d
- Multiples-Testen-Korrektur: Benjamini-Hochberg
- Slice-Aufschlüsselungen
- Lokales Caching zur Kostenkontrolle
- Fortsetzbare Läufe
- Einzeldatei-HTML-Bericht + JSON-Ausgabe
Das enge Ziel des Projekts ist die Migrationssicherheit: „Kann ich Modelle wechseln, ohne mein Prompt-/Agentenverhalten zu beeinträchtigen?“ Der Autor betont, dass stille Agentenregressionen erkannt werden – z. B. ein neueres Modell, das eine anständig aussehende endgültige Antwort liefert, aber einen erforderlichen Tool-Aufruf überspringt, das falsche Tool aufruft oder Argumente verändert.
Anwendungsfälle
- Claude 4.5 → Claude 5
- GPT-5 → GPT-6
- Gemini 2 → 3
- Lokales Modell → gehostetes Modell
Der Autor bittet um Feedback zur Nützlichkeit für lokale vs. gehostete Modelle, zu den wichtigsten Evaluatortypen für lokale LLM-Workflows und ob Tool-Call-/Structured-Output-Regressionen ein echtes Problem darstellen. Das Repo ist MIT-lizenziert.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Lokales Terminal-CRM mit integriertem MCP-Server für Claude-Integration
Ein Entwickler hat ein persönliches CRM-System erstellt, das vollständig im Terminal läuft und Daten lokal in SQLite speichert. Es enthält einen integrierten MCP-Server, der Claude Zugriff auf 18 Tools zur Verwaltung von Kontakten, Deals und Nachverfolgungen bietet.

Berater: Ein /advisor Slash-Befehl für Claude Code, der Opus + parallele Sonnet-Runner ausführt
Ein /advisor-Befehl für Claude Code lässt Opus als Stratege fungieren, der mehrere Sonnet-Runner koordiniert, die parallel Dateien lesen. Dabei wurden sechs echte Fehler gefunden, darunter eine Bidi-Zeichen-Trojan-Source-Lücke.

Claude-Skills-Maintainer sucht Feedback zu 181 Agent Skills Library
Reza, der Betreuer von claude-skills, bittet die Community um Feedback zu seiner Open-Source-Bibliothek, die 181 Agenten-Fähigkeiten, 250 Python-Tools und 15 Agenten-Personas enthält, die über 11 KI-Codierungstools hinweg funktionieren. Er hinterfragt, ob der isolierte Fähigkeitsansatz effektiv ist, und möchte Input zu fehlenden Fähigkeiten, persona-basierten Agenten und Tool-Integrationen.

QCAI-App bietet mobiles Kontrollzentrum für das OpenClaw-Ökosystem
Ein akademisches Forschungsteam veröffentlicht die QCAI-App für iOS und Android, die mit KI-unterstützter Entwicklung erstellt wurde und Dashboard-Überwachung, Gateway-Chat und sicheren VPN-Zugang zu OpenClaw-Tools bietet.