EvalShift: Open-Source-CLI zur Erkennung von LLM-Regressionen bei der Modellmigration

✍️ OpenClawRadar📅 Veröffentlicht: 15. Mai 2026🔗 Source
EvalShift: Open-Source-CLI zur Erkennung von LLM-Regressionen bei der Modellmigration
Ad

EvalShift ist ein quelloffenes Python-CLI, das entwickelt wurde, um Regressionen beim Wechsel zwischen LLMs oder Modellversionen zu erkennen. Es führt Ihre goldenen Inputsuiten sowohl gegen das Quell- als auch das Zielmodell aus, bewertet die Ausgaben und erstellt einen lokalen HTML-Bericht – ohne Backend, Konten oder Telemetrie.

Hauptfunktionen

  • Vergleich von Quell- und Zielmodell über LiteLLM
  • JSONL-Gold-Suiten mit Tags/Slices
  • Strukturelle Evaluatoren: JSON-Schema, Regex, Länge
  • Semantischer Evaluator: Embedding-Ähnlichkeit
  • LLM-als-Richter Paarvergleich
  • Tool-Call-Evaluatoren: Tool-Auswahl, Argumentabgleich, Ablaufstruktur
  • Gepaarte statistische Tests: t-Test / Wilcoxon
  • Effektstärken: Cohens d
  • Multiples-Testen-Korrektur: Benjamini-Hochberg
  • Slice-Aufschlüsselungen
  • Lokales Caching zur Kostenkontrolle
  • Fortsetzbare Läufe
  • Einzeldatei-HTML-Bericht + JSON-Ausgabe

Das enge Ziel des Projekts ist die Migrationssicherheit: „Kann ich Modelle wechseln, ohne mein Prompt-/Agentenverhalten zu beeinträchtigen?“ Der Autor betont, dass stille Agentenregressionen erkannt werden – z. B. ein neueres Modell, das eine anständig aussehende endgültige Antwort liefert, aber einen erforderlichen Tool-Aufruf überspringt, das falsche Tool aufruft oder Argumente verändert.

Ad

Anwendungsfälle

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • Lokales Modell → gehostetes Modell

Der Autor bittet um Feedback zur Nützlichkeit für lokale vs. gehostete Modelle, zu den wichtigsten Evaluatortypen für lokale LLM-Workflows und ob Tool-Call-/Structured-Output-Regressionen ein echtes Problem darstellen. Das Repo ist MIT-lizenziert.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Nelson v2.2.3 veröffentlicht: Multi-Agent-Koordination für Claude Code, plus ein Benchmark für diskrete Ereignissimulation
Werkzeuge

Nelson v2.2.3 veröffentlicht: Multi-Agent-Koordination für Claude Code, plus ein Benchmark für diskrete Ereignissimulation

Nelson v2.2.3 enthält eine Multi-Agenten-Koordinationsfähigkeit für Claude Code, die eine maritime Metapher verwendet. Ein Benchmark mit 13 Konfigurationen zeigt, dass opus-4-7 mit Denkmodus dominiert; die Wahl der Fähigkeit spielt eine geringere Rolle.

OpenClawRadar
Open-Source-Claude-Code-Fähigkeit diagnostiziert Hindernisse bei der KI-Einführung
Werkzeuge

Open-Source-Claude-Code-Fähigkeit diagnostiziert Hindernisse bei der KI-Einführung

Eine MIT-lizenzierte Claude Code-Fähigkeit analysiert, wo Unternehmen bei der KI-Einführung stecken bleiben – bei Tools, Kultur oder Messung – und erstellt 90-Tage-Pläne mit benannten Verantwortlichen. Basierend auf Interviews mit über 100 Gründern und Vorstandsmitgliedern.

OpenClawRadar
Claude AIs UltraThink-Funktion kehrt zurück mit praktischen Nutzungshinweisen
Werkzeuge

Claude AIs UltraThink-Funktion kehrt zurück mit praktischen Nutzungshinweisen

Claude AI hat die UltraThink-Funktion nach Nutzerfeedback wieder eingeführt. Mittlerer Aufwand ist jetzt die Standardeinstellung für Opus 4.6 (Max/Team), wobei Hoher Aufwand dauerhaft über /model verfügbar ist und UltraThink als einmalige Überschreibung für hohen Aufwand dient.

OpenClawRadar
Hyper iOS App: Sprachnotizen-App mit Echtzeit-Transkription und Aktionserkennung
Werkzeuge

Hyper iOS App: Sprachnotizen-App mit Echtzeit-Transkription und Aktionserkennung

Hyper ist eine iOS-Sprachaufnahme-App, die Gespräche in Echtzeit transkribiert, Zusammenfassungen und Aktionspunkte liefert und mittels Wakeword-Erkennung Abfragen während des Gesprächs ermöglicht. Sie ist für unstrukturierte Meetings wie 1:1-Gespräche, Kaffeepausen und Standups konzipiert.

OpenClawRadar