EvalShift: Open-Source-CLI zur Erkennung von LLM-Regressionen bei der Modellmigration

✍️ OpenClawRadar📅 Veröffentlicht: 15. Mai 2026🔗 Source
EvalShift: Open-Source-CLI zur Erkennung von LLM-Regressionen bei der Modellmigration
Ad

EvalShift ist ein quelloffenes Python-CLI, das entwickelt wurde, um Regressionen beim Wechsel zwischen LLMs oder Modellversionen zu erkennen. Es führt Ihre goldenen Inputsuiten sowohl gegen das Quell- als auch das Zielmodell aus, bewertet die Ausgaben und erstellt einen lokalen HTML-Bericht – ohne Backend, Konten oder Telemetrie.

Hauptfunktionen

  • Vergleich von Quell- und Zielmodell über LiteLLM
  • JSONL-Gold-Suiten mit Tags/Slices
  • Strukturelle Evaluatoren: JSON-Schema, Regex, Länge
  • Semantischer Evaluator: Embedding-Ähnlichkeit
  • LLM-als-Richter Paarvergleich
  • Tool-Call-Evaluatoren: Tool-Auswahl, Argumentabgleich, Ablaufstruktur
  • Gepaarte statistische Tests: t-Test / Wilcoxon
  • Effektstärken: Cohens d
  • Multiples-Testen-Korrektur: Benjamini-Hochberg
  • Slice-Aufschlüsselungen
  • Lokales Caching zur Kostenkontrolle
  • Fortsetzbare Läufe
  • Einzeldatei-HTML-Bericht + JSON-Ausgabe

Das enge Ziel des Projekts ist die Migrationssicherheit: „Kann ich Modelle wechseln, ohne mein Prompt-/Agentenverhalten zu beeinträchtigen?“ Der Autor betont, dass stille Agentenregressionen erkannt werden – z. B. ein neueres Modell, das eine anständig aussehende endgültige Antwort liefert, aber einen erforderlichen Tool-Aufruf überspringt, das falsche Tool aufruft oder Argumente verändert.

Ad

Anwendungsfälle

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Lokales Modell → gehostetes Modell

Der Autor bittet um Feedback zur Nützlichkeit für lokale vs. gehostete Modelle, zu den wichtigsten Evaluatortypen für lokale LLM-Workflows und ob Tool-Call-/Structured-Output-Regressionen ein echtes Problem darstellen. Das Repo ist MIT-lizenziert.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Lokales Terminal-CRM mit integriertem MCP-Server für Claude-Integration
Werkzeuge

Lokales Terminal-CRM mit integriertem MCP-Server für Claude-Integration

Ein Entwickler hat ein persönliches CRM-System erstellt, das vollständig im Terminal läuft und Daten lokal in SQLite speichert. Es enthält einen integrierten MCP-Server, der Claude Zugriff auf 18 Tools zur Verwaltung von Kontakten, Deals und Nachverfolgungen bietet.

OpenClawRadar
Berater: Ein /advisor Slash-Befehl für Claude Code, der Opus + parallele Sonnet-Runner ausführt
Werkzeuge

Berater: Ein /advisor Slash-Befehl für Claude Code, der Opus + parallele Sonnet-Runner ausführt

Ein /advisor-Befehl für Claude Code lässt Opus als Stratege fungieren, der mehrere Sonnet-Runner koordiniert, die parallel Dateien lesen. Dabei wurden sechs echte Fehler gefunden, darunter eine Bidi-Zeichen-Trojan-Source-Lücke.

OpenClawRadar
Claude-Skills-Maintainer sucht Feedback zu 181 Agent Skills Library
Werkzeuge

Claude-Skills-Maintainer sucht Feedback zu 181 Agent Skills Library

Reza, der Betreuer von claude-skills, bittet die Community um Feedback zu seiner Open-Source-Bibliothek, die 181 Agenten-Fähigkeiten, 250 Python-Tools und 15 Agenten-Personas enthält, die über 11 KI-Codierungstools hinweg funktionieren. Er hinterfragt, ob der isolierte Fähigkeitsansatz effektiv ist, und möchte Input zu fehlenden Fähigkeiten, persona-basierten Agenten und Tool-Integrationen.

OpenClawRadar
QCAI-App bietet mobiles Kontrollzentrum für das OpenClaw-Ökosystem
Werkzeuge

QCAI-App bietet mobiles Kontrollzentrum für das OpenClaw-Ökosystem

Ein akademisches Forschungsteam veröffentlicht die QCAI-App für iOS und Android, die mit KI-unterstützter Entwicklung erstellt wurde und Dashboard-Überwachung, Gateway-Chat und sicheren VPN-Zugang zu OpenClaw-Tools bietet.

OpenClawRadar