Arena KI-Modell ELO-Verlauf verfolgt LLM-Leistungsverfall über Zeit

Erwin Mayers Arena AI Model ELO History (Live-Tracker) zeichnet historische ELO-Bewertungen aus dem LMSYS Arena Leaderboard auf, um Leistungstrends der Flaggschiff-KI-Modelle sichtbar zu machen. Die Kernaussage: Modelle, die sich beim Launch großartig anfühlen, verschlechtern sich oft Wochen später aufgrund von stillen Updates, Quantisierung oder Änderungen an Sicherheits-Wrappern.
Hauptfunktionen
- Eine Kurve pro Labor: Statt einem Spaghetti-Diagramm aller Varianten erhält jedes große KI-Labor eine durchgehende Linie, die zu jedem Zeitpunkt ihr höchstbewertetes Flaggschiff-Modell repräsentiert.
- Logik zur Verfolgung von Flaggschiffen: Die Kurve bleibt beim Top-Modell (z. B. bleibt Opus aktiv, bis ein neues höher bewertetes Modell erscheint). Mittelklasse-Veröffentlichungen wie Sonnet verursachen keinen Sprung, solange Opus führt.
- Inferenzmodi zusammengefasst: Suffixe wie
-thinking,-reasoning,-highwerden unter dem Basismodell zusammengefasst, um Hin- und Herspringen zu vermeiden. - Markierungen neuer Veröffentlichungen: Veröffentlichungen werden als beschriftete Punkte dargestellt, meist begleitet von Bewertungssprüngen.
- Verschlechterung sichtbar: Abwärtstrends innerhalb des Lebenszyklus eines Modells zwischen Veröffentlichungen werden klar dargestellt.
- Mobilfreundlich + Dark Mode inklusive.
Datenquelle
Die Daten werden täglich automatisch aus dem offiziellen LMSYS Arena Dataset auf Hugging Face abgerufen. Die Arena verwendet tausende blinde, von Menschen durchgeführte Crowdsourcing-Bewertungen über API-Endpunkte – nicht über Consumer-Web-UIs.
Kritischer blinder Fleck: Web UI vs. API
Der Autor weist auf eine wesentliche Einschränkung hin: LMSYS testet reine API-Modelle. Consumer-Oberflächen (chatgpt.com, gemini.com) fügen umfangreiche System-Prompts und Sicherheits-Wrapper hinzu und wechseln unter Last möglicherweise stillschweigend zu quantisierten Modellen. Das Projekt sucht historische ELO- oder Evaluierungsdatensätze von tatsächlichen Web-UIs, um die „Verschlechterung“ zu erfassen, die Nutzer erleben. PRs mit solchen Datensätzen sind willkommen (Repo-Link in der Fußzeile).
Für wen es gedacht ist
Entwickler und Forscher, die die LLM-Modellqualität im Laufe der Zeit verfolgen, insbesondere diejenigen, die KI-Agenten einsetzen, die auf konsistentem Modellverhalten basieren.
📖 Vollständige Quelle lesen: HN LLM Tools
👀 Siehe auch

ai-codex: Indizieren Sie Ihre Codebasis im Voraus, um Claude-Tokens zu sparen
ai-codex ist ein Tool, das kompakte Markdown-Indizes Ihres Codebestands generiert, sodass Claude Code die anfängliche Erkundungsphase überspringen kann, die normalerweise 30-50K Tokens pro Konversation verbraucht. Es erstellt fünf Dateien, die Routen, Seiten, Bibliotheken, Schemata und Komponenten abdecken.

TranscriptionSuite v1.1.2 fügt WhisperX-, NeMo- und VibeVoice-Modelle hinzu.
TranscriptionSuite v1.1.2 bietet nun drei Transkriptions-Pipelines: WhisperX mit PyAnnote-Diarisierung, NeMo-Modelle (Parakeet & Canary) mit PyAnnote-Diarisierung und VibeVoice-Modelle mit integrierter Diarisierung. Das Update umfasst einen Modell-Manager, parallele Verarbeitung, Tastenkürzel-Steuerungen und eine 24kHz-Aufnahmepipeline für VibeVoice.

Jan fügt Ein-Klick-OpenClaw-Installation mit Jan-v3-Base-Modell-Integration hinzu
Jan unterstützt jetzt die Ein-Klick-Installation von OpenClaw mit direkter Integration in das Jan-v3-Basismodell, wobei alle Vorgänge lokal und privat auf Ihrem Computer bleiben.

Pi-Coding-Agent mit Qwen 35B Q2: Dateisystem als externen Speicher nutzen und Kontextschutz erzwingen
Ein Reddit-Nutzer hat einen Stack um den Pi-Coding-Agenten mit Qwen 35B Q2_K_XL-Quantisierung gebaut, der Schutzmechanismen durchsetzt – bearbeitet keine Ausgaben über 100 Zeilen, begrenzt Denkblöcke auf 2000 Zeichen und überwacht den Kontext bei 65 %/80 % – und das Dateisystem als Gedächtnis des Modells behandelt, nicht den Kontextfenster.