Historique ELO du modèle Arena AI suit la dégradation des performances des LLM au fil du temps

L'historique des classements ELO de l'Arena AI de Erwin Mayer (suivi en direct) représente les classements ELO historiques du classement LMSYS Arena pour exposer les tendances de performances des modèles d'IA phares. La principale observation : les modèles qui semblent excellents au lancement se dégradent souvent des semaines plus tard en raison de mises à jour silencieuses, de la quantification ou de modifications des couches de sécurité.
Fonctionnalités clés
- Une courbe par laboratoire : Au lieu d'un graphique spaghetti de toutes les variantes, chaque grand laboratoire d'IA obtient une ligne continue unique représentant son modèle phare le mieux noté à un moment donné.
- Logique de suivi des modèles phares : La courbe reste sur le modèle de premier plan (par exemple, Opus reste actif jusqu'à l'apparition d'un modèle mieux noté). Les versions intermédiaires comme Sonnet ne provoquent pas de saut tant qu'Opus est en tête.
- Fusion des modes d'inférence : Les suffixes comme
-thinking,-reasoning,-highsont regroupés sous le modèle de base pour éviter les oscillations. - Marqueurs de nouvelles versions : Les versions sont représentées par des points étiquetés, généralement accompagnés de sauts de score.
- Dégradation visible : Les tendances à la baisse au sein du cycle de vie d'un modèle entre les versions sont clairement tracées.
- Compatible mobile + mode sombre inclus.
Source des données
Les données sont récupérées automatiquement chaque jour à partir de l'ensemble de données officiel LMSYS Arena sur Hugging Face. L'Arena utilise des milliers d'évaluations humaines anonymes via des points d'API — pas les interfaces utilisateur Web grand public.
Angle mort critique : Interface Web vs API
L'auteur reconnaît une limitation clé : LMSYS teste les modèles API bruts. Les interfaces grand public (chatgpt.com, gemini.com) ajoutent des invites système lourdes, des couches de sécurité et peuvent basculer silencieusement vers des modèles quantifiés en cas de charge. Ce projet recherche des classements ELO historiques ou des ensembles de données d'évaluation provenant d'interfaces Web réelles pour capturer la « dégradation » subie par les utilisateurs. Les contributions avec de tels ensembles de données sont les bienvenues (lien vers le dépôt en bas de page).
À qui cela s'adresse
Développeurs et chercheurs qui suivent la qualité des modèles de LLM au fil du temps, en particulier ceux qui déploient des agents d'IA dépendant d'un comportement constant des modèles.
📖 Lire la source complète : HN LLM Tools
👀 See Also

mcp-optimizer réduit le gaspillage de jetons causé par les serveurs MCP inactifs dans Claude Code
mcp-optimizer est un plugin qui résout le gaspillage de jetons provenant des serveurs MCP dans Claude Code en analysant l'utilisation des outils et en générant des configurations optimisées. Il comprend quatre utilitaires : mcp-doctor pour les vérifications de santé des serveurs, mcp-audit pour l'analyse d'utilisation, mcp-optimize pour créer des configurations locales au projet, et mcp-to-skills pour convertir les outils en compétences à la demande.

Le benchmark révèle que les outils d'automatisation de navigation par IA varient jusqu'à 2,6 fois en coût de tokens, malgré une précision identique.
Un benchmark de 4 outils d'automatisation de navigateur en CLI utilisant Claude Sonnet 4.6 sur 6 tâches réelles a révélé que tous ont atteint 100% de précision, mais openbrowser-ai a utilisé 36 010 tokens tandis que les autres ont utilisé 77 123 à 94 130 tokens. Le nombre d'appels d'outils était le prédicteur le plus fort du coût en tokens.

Autoencodeurs de langage naturel : Transformer les représentations internes de Claude en texte
Transformer Circuits Thread publie Natural Language Autoencoders qui déchiffrent les activations internes de Claude en texte lisible. Dépôt GitHub et démo interactive disponibles.

Pepper MCP Serveur pour l'Interaction et le Débogage du Simulateur iOS
Pepper est un serveur MCP qui injecte une bibliothèque dynamique (dylib) dans les applications du simulateur iOS via DYLD_INSERT_LIBRARIES, permettant une interaction en temps réel, la lecture d'écran, le clic de boutons, l'inspection de variables et la surveillance du trafic réseau via un pont WebSocket.