Historique ELO du modèle Arena AI suit la dégradation des performances des LLM au fil du temps

L'historique des classements ELO de l'Arena AI de Erwin Mayer (suivi en direct) représente les classements ELO historiques du classement LMSYS Arena pour exposer les tendances de performances des modèles d'IA phares. La principale observation : les modèles qui semblent excellents au lancement se dégradent souvent des semaines plus tard en raison de mises à jour silencieuses, de la quantification ou de modifications des couches de sécurité.
Fonctionnalités clés
- Une courbe par laboratoire : Au lieu d'un graphique spaghetti de toutes les variantes, chaque grand laboratoire d'IA obtient une ligne continue unique représentant son modèle phare le mieux noté à un moment donné.
- Logique de suivi des modèles phares : La courbe reste sur le modèle de premier plan (par exemple, Opus reste actif jusqu'à l'apparition d'un modèle mieux noté). Les versions intermédiaires comme Sonnet ne provoquent pas de saut tant qu'Opus est en tête.
- Fusion des modes d'inférence : Les suffixes comme
-thinking,-reasoning,-highsont regroupés sous le modèle de base pour éviter les oscillations. - Marqueurs de nouvelles versions : Les versions sont représentées par des points étiquetés, généralement accompagnés de sauts de score.
- Dégradation visible : Les tendances à la baisse au sein du cycle de vie d'un modèle entre les versions sont clairement tracées.
- Compatible mobile + mode sombre inclus.
Source des données
Les données sont récupérées automatiquement chaque jour à partir de l'ensemble de données officiel LMSYS Arena sur Hugging Face. L'Arena utilise des milliers d'évaluations humaines anonymes via des points d'API — pas les interfaces utilisateur Web grand public.
Angle mort critique : Interface Web vs API
L'auteur reconnaît une limitation clé : LMSYS teste les modèles API bruts. Les interfaces grand public (chatgpt.com, gemini.com) ajoutent des invites système lourdes, des couches de sécurité et peuvent basculer silencieusement vers des modèles quantifiés en cas de charge. Ce projet recherche des classements ELO historiques ou des ensembles de données d'évaluation provenant d'interfaces Web réelles pour capturer la « dégradation » subie par les utilisateurs. Les contributions avec de tels ensembles de données sont les bienvenues (lien vers le dépôt en bas de page).
À qui cela s'adresse
Développeurs et chercheurs qui suivent la qualité des modèles de LLM au fil du temps, en particulier ceux qui déploient des agents d'IA dépendant d'un comportement constant des modèles.
📖 Lire la source complète : HN LLM Tools
👀 See Also

Développé un logiciel de comptabilité forensique avec mon père — CaseTrail automatise la détection des fraudes financières
Un duo père-fils a développé CaseTrail, un outil de comptabilité judiciaire basé sur l'IA qui ingère les relevés bancaires et identifie les anomalies. L'article détaille l'intégration avec les LLM pour l'analyse des transactions.

Architecte d'Agent : Un Outil Gratuit Génère des Fichiers Complets d'Espace de Travail pour les Agents IA
Agent Architect est un outil interactif gratuit qui guide les utilisateurs à travers plus de 40 questions sur leur agent IA, puis compile le tout en un prompt formaté pour générer sept fichiers d'espace de travail de qualité production : SOUL.md, IDENTITY.md, AGENTS.md, OPERATIONS.md, TOOLS.md, MEMORY.md et HEARTBEAT.md.

ClawControl v1.3.1 ajoute la prise en charge des médias, la dictée vocale et l'empaquetage Linux.
ClawControl v1.3.1 est un client OpenClaw multiplateforme qui prend désormais en charge le partage d'images, la dictation vocale par mot d'activation, les graphiques d'utilisation et les packages Linux AppImage/.deb. La version inclut des mises à jour de sécurité nécessitant aux utilisateurs d'OpenClaw 2.19+ de mettre à jour les Origines Autorisées de l'Interface de Contrôle.

Corbell : CLI Open Source pour l'Analyse d'Architecture et la Documentation de Conception Multi-Dépôts
Corbell est un outil CLI gratuit et open source qui analyse plusieurs dépôts pour construire un graphe d'architecture et générer une documentation de conception localement. Il fonctionne entièrement hors ligne avec Ollama ou prend en charge divers fournisseurs de LLM, et n'envoie jamais le code hors de votre machine.