Arena KI-Modell ELO-Verlauf verfolgt LLM-Leistungsverfall über Zeit

✍️ OpenClawRadar📅 Veröffentlicht: 14. Mai 2026🔗 Source
Arena KI-Modell ELO-Verlauf verfolgt LLM-Leistungsverfall über Zeit
Ad

Erwin Mayers Arena AI Model ELO History (Live-Tracker) zeichnet historische ELO-Bewertungen aus dem LMSYS Arena Leaderboard auf, um Leistungstrends der Flaggschiff-KI-Modelle sichtbar zu machen. Die Kernaussage: Modelle, die sich beim Launch großartig anfühlen, verschlechtern sich oft Wochen später aufgrund von stillen Updates, Quantisierung oder Änderungen an Sicherheits-Wrappern.

Hauptfunktionen

  • Eine Kurve pro Labor: Statt einem Spaghetti-Diagramm aller Varianten erhält jedes große KI-Labor eine durchgehende Linie, die zu jedem Zeitpunkt ihr höchstbewertetes Flaggschiff-Modell repräsentiert.
  • Logik zur Verfolgung von Flaggschiffen: Die Kurve bleibt beim Top-Modell (z. B. bleibt Opus aktiv, bis ein neues höher bewertetes Modell erscheint). Mittelklasse-Veröffentlichungen wie Sonnet verursachen keinen Sprung, solange Opus führt.
  • Inferenzmodi zusammengefasst: Suffixe wie -thinking, -reasoning, -high werden unter dem Basismodell zusammengefasst, um Hin- und Herspringen zu vermeiden.
  • Markierungen neuer Veröffentlichungen: Veröffentlichungen werden als beschriftete Punkte dargestellt, meist begleitet von Bewertungssprüngen.
  • Verschlechterung sichtbar: Abwärtstrends innerhalb des Lebenszyklus eines Modells zwischen Veröffentlichungen werden klar dargestellt.
  • Mobilfreundlich + Dark Mode inklusive.
Ad

Datenquelle

Die Daten werden täglich automatisch aus dem offiziellen LMSYS Arena Dataset auf Hugging Face abgerufen. Die Arena verwendet tausende blinde, von Menschen durchgeführte Crowdsourcing-Bewertungen über API-Endpunkte – nicht über Consumer-Web-UIs.

Kritischer blinder Fleck: Web UI vs. API

Der Autor weist auf eine wesentliche Einschränkung hin: LMSYS testet reine API-Modelle. Consumer-Oberflächen (chatgpt.com, gemini.com) fügen umfangreiche System-Prompts und Sicherheits-Wrapper hinzu und wechseln unter Last möglicherweise stillschweigend zu quantisierten Modellen. Das Projekt sucht historische ELO- oder Evaluierungsdatensätze von tatsächlichen Web-UIs, um die „Verschlechterung“ zu erfassen, die Nutzer erleben. PRs mit solchen Datensätzen sind willkommen (Repo-Link in der Fußzeile).

Für wen es gedacht ist

Entwickler und Forscher, die die LLM-Modellqualität im Laufe der Zeit verfolgen, insbesondere diejenigen, die KI-Agenten einsetzen, die auf konsistentem Modellverhalten basieren.

📖 Vollständige Quelle lesen: HN LLM Tools

Ad

👀 Siehe auch

Ersetzen komplexer Abrufpipelines durch einfache Git-Shell-Befehle für LLM-Agenten
Werkzeuge

Ersetzen komplexer Abrufpipelines durch einfache Git-Shell-Befehle für LLM-Agenten

Ein Entwickler ersetzte seine gesamte KI-Agenten-Abrufpipeline (sentence-transformers, rank-bm25, zweistufige LLM-Pipeline) durch ein einziges Tool, das dem Agenten ermöglicht, schreibgeschützte Shell-Befehle gegen ein Git-Repository auszuführen, wodurch die Docker-Image-Größe um ~3 GB reduziert und Timeout-Probleme beseitigt wurden.

OpenClawRadar
Kurzfassung schlägt Höhlenmensch-Plugin im Claude-Code-Kompressions-Benchmark
Werkzeuge

Kurzfassung schlägt Höhlenmensch-Plugin im Claude-Code-Kompressions-Benchmark

Ein Benchmark mit 24 Prompts zeigt, dass Claude Codes Höhlenmenschen-Komprimierungs-Plugin dieselbe Token-Anzahl und Qualität liefert wie das einfache Voranstellen von „sei kurz.“ – aber die konsistente Ausgabeform und Sicherheitsregeln des Plugins bieten strukturelle Vorteile.

OpenClawRadar
🦀
Werkzeuge

Wie ich über KI denke: Die ehrliche Sicht eines Entwicklers auf Reasoning, Untergang und das offene Web

Ein Entwickler denkt über KI nach: LLMs mit Bauchgefühl und emergenter Vernunft, die Gefahr der Superintelligenz und die Belastung für das offene Web und Künstler.

OpenClawRadar
Forge: Eine Claude-basierte IDE mit automatisierter Verifizierung und Projekt-DNA
Werkzeuge

Forge: Eine Claude-basierte IDE mit automatisierter Verifizierung und Projekt-DNA

Forge ist eine auf Claude basierende IDE, die auf VS Code aufbaut und automatisch Typüberprüfung, Tests, Abdeckungsprüfungen und Importvalidierung durchführt, bevor Code angezeigt wird. Sie enthält Selbstheilungsschleifen für fehlgeschlagene Verifizierungen und erstellt eine Projekt-DNA der Muster Ihrer Codebasis.

OpenClawRadar