EvalShift: Open-Source-CLI zur Erkennung von LLM-Regressionen bei der Modellmigration

EvalShift ist ein quelloffenes Python-CLI, das entwickelt wurde, um Regressionen beim Wechsel zwischen LLMs oder Modellversionen zu erkennen. Es führt Ihre goldenen Inputsuiten sowohl gegen das Quell- als auch das Zielmodell aus, bewertet die Ausgaben und erstellt einen lokalen HTML-Bericht – ohne Backend, Konten oder Telemetrie.
Hauptfunktionen
- Vergleich von Quell- und Zielmodell über LiteLLM
- JSONL-Gold-Suiten mit Tags/Slices
- Strukturelle Evaluatoren: JSON-Schema, Regex, Länge
- Semantischer Evaluator: Embedding-Ähnlichkeit
- LLM-als-Richter Paarvergleich
- Tool-Call-Evaluatoren: Tool-Auswahl, Argumentabgleich, Ablaufstruktur
- Gepaarte statistische Tests: t-Test / Wilcoxon
- Effektstärken: Cohens d
- Multiples-Testen-Korrektur: Benjamini-Hochberg
- Slice-Aufschlüsselungen
- Lokales Caching zur Kostenkontrolle
- Fortsetzbare Läufe
- Einzeldatei-HTML-Bericht + JSON-Ausgabe
Das enge Ziel des Projekts ist die Migrationssicherheit: „Kann ich Modelle wechseln, ohne mein Prompt-/Agentenverhalten zu beeinträchtigen?“ Der Autor betont, dass stille Agentenregressionen erkannt werden – z. B. ein neueres Modell, das eine anständig aussehende endgültige Antwort liefert, aber einen erforderlichen Tool-Aufruf überspringt, das falsche Tool aufruft oder Argumente verändert.
Anwendungsfälle
- Claude 4.5 → Claude 5
- GPT-5 → GPT-6
- Gemini 2 → 3
- Lokales Modell → gehostetes Modell
Der Autor bittet um Feedback zur Nützlichkeit für lokale vs. gehostete Modelle, zu den wichtigsten Evaluatortypen für lokale LLM-Workflows und ob Tool-Call-/Structured-Output-Regressionen ein echtes Problem darstellen. Das Repo ist MIT-lizenziert.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Nelson v2.2.3 veröffentlicht: Multi-Agent-Koordination für Claude Code, plus ein Benchmark für diskrete Ereignissimulation
Nelson v2.2.3 enthält eine Multi-Agenten-Koordinationsfähigkeit für Claude Code, die eine maritime Metapher verwendet. Ein Benchmark mit 13 Konfigurationen zeigt, dass opus-4-7 mit Denkmodus dominiert; die Wahl der Fähigkeit spielt eine geringere Rolle.

Open-Source-Claude-Code-Fähigkeit diagnostiziert Hindernisse bei der KI-Einführung
Eine MIT-lizenzierte Claude Code-Fähigkeit analysiert, wo Unternehmen bei der KI-Einführung stecken bleiben – bei Tools, Kultur oder Messung – und erstellt 90-Tage-Pläne mit benannten Verantwortlichen. Basierend auf Interviews mit über 100 Gründern und Vorstandsmitgliedern.

Claude AIs UltraThink-Funktion kehrt zurück mit praktischen Nutzungshinweisen
Claude AI hat die UltraThink-Funktion nach Nutzerfeedback wieder eingeführt. Mittlerer Aufwand ist jetzt die Standardeinstellung für Opus 4.6 (Max/Team), wobei Hoher Aufwand dauerhaft über /model verfügbar ist und UltraThink als einmalige Überschreibung für hohen Aufwand dient.

Hyper iOS App: Sprachnotizen-App mit Echtzeit-Transkription und Aktionserkennung
Hyper ist eine iOS-Sprachaufnahme-App, die Gespräche in Echtzeit transkribiert, Zusammenfassungen und Aktionspunkte liefert und mittels Wakeword-Erkennung Abfragen während des Gesprächs ermöglicht. Sie ist für unstrukturierte Meetings wie 1:1-Gespräche, Kaffeepausen und Standups konzipiert.