Arena KI-Modell ELO-Verlauf verfolgt LLM-Leistungsverfall über Zeit

Erwin Mayers Arena AI Model ELO History (Live-Tracker) zeichnet historische ELO-Bewertungen aus dem LMSYS Arena Leaderboard auf, um Leistungstrends der Flaggschiff-KI-Modelle sichtbar zu machen. Die Kernaussage: Modelle, die sich beim Launch großartig anfühlen, verschlechtern sich oft Wochen später aufgrund von stillen Updates, Quantisierung oder Änderungen an Sicherheits-Wrappern.
Hauptfunktionen
- Eine Kurve pro Labor: Statt einem Spaghetti-Diagramm aller Varianten erhält jedes große KI-Labor eine durchgehende Linie, die zu jedem Zeitpunkt ihr höchstbewertetes Flaggschiff-Modell repräsentiert.
- Logik zur Verfolgung von Flaggschiffen: Die Kurve bleibt beim Top-Modell (z. B. bleibt Opus aktiv, bis ein neues höher bewertetes Modell erscheint). Mittelklasse-Veröffentlichungen wie Sonnet verursachen keinen Sprung, solange Opus führt.
- Inferenzmodi zusammengefasst: Suffixe wie
-thinking,-reasoning,-highwerden unter dem Basismodell zusammengefasst, um Hin- und Herspringen zu vermeiden. - Markierungen neuer Veröffentlichungen: Veröffentlichungen werden als beschriftete Punkte dargestellt, meist begleitet von Bewertungssprüngen.
- Verschlechterung sichtbar: Abwärtstrends innerhalb des Lebenszyklus eines Modells zwischen Veröffentlichungen werden klar dargestellt.
- Mobilfreundlich + Dark Mode inklusive.
Datenquelle
Die Daten werden täglich automatisch aus dem offiziellen LMSYS Arena Dataset auf Hugging Face abgerufen. Die Arena verwendet tausende blinde, von Menschen durchgeführte Crowdsourcing-Bewertungen über API-Endpunkte – nicht über Consumer-Web-UIs.
Kritischer blinder Fleck: Web UI vs. API
Der Autor weist auf eine wesentliche Einschränkung hin: LMSYS testet reine API-Modelle. Consumer-Oberflächen (chatgpt.com, gemini.com) fügen umfangreiche System-Prompts und Sicherheits-Wrapper hinzu und wechseln unter Last möglicherweise stillschweigend zu quantisierten Modellen. Das Projekt sucht historische ELO- oder Evaluierungsdatensätze von tatsächlichen Web-UIs, um die „Verschlechterung“ zu erfassen, die Nutzer erleben. PRs mit solchen Datensätzen sind willkommen (Repo-Link in der Fußzeile).
Für wen es gedacht ist
Entwickler und Forscher, die die LLM-Modellqualität im Laufe der Zeit verfolgen, insbesondere diejenigen, die KI-Agenten einsetzen, die auf konsistentem Modellverhalten basieren.
📖 Vollständige Quelle lesen: HN LLM Tools
👀 Siehe auch

OpenClaw Plugin für AxonFlow: Vorab-Genehmigung von Tools & PII-Schwärzung
Ein selbst gehostetes OpenClaw-Plugin, das Tool-Argumente vor der Ausführung prüft, riskante Aufrufe für menschliche Freigabe pausiert und PII aus ausgehenden Nachrichten entfernt. Nutzt OpenClaw-Lifecycle-Hooks – keine Code-Änderungen am Agenten nötig.

Eä: Ein SIMD-Compiler für Python, geschrieben in Rust
Ein Entwickler hat Eä erstellt, einen Compiler für SIMD-Kernel in etwa 12.000 Zeilen Rust-Code, der aus .ea-Dateien Shared Libraries und Python-Wrapper generiert und dabei 6,6-fache Geschwindigkeitssteigerungen gegenüber NumPy ohne ctypes oder Build-Systeme erzielt.

Claude Cowork-Modus erklärt: Dateiübergreifende Aufgabenausführung im Vergleich zu Chat- und Code-Modi
Claudes Cowork-Modus arbeitet innerhalb eines ausgewählten Ordners, um Datei-bezogene Aufgaben zu erledigen, wie das Organisieren unordentlicher Ordner, das Extrahieren strukturierter Daten aus Screenshots und das Zusammenfassen verstreuter Notizen in strukturierte Dokumente.

Gratis macOS Menüleisten-App zeigt Echtzeit-Claude-Nutzungsstatistiken via SQLite-Cookie-Entschlüsselung
Claude Usage Tracker ist eine kostenlose macOS-Menüleisten-App, die die verschlüsselten SQLite-Cookies der Claude-Desktop-App ausliest, sie via Keychain entschlüsselt und Sitzungsprozente, wöchentliches Limit, Ausgaben und Routineläufe lokal anzeigt – kein API-Key erforderlich.