Historial de ELO del modelo Arena AI rastrea la degradación del rendimiento de LLM a lo largo del tiempo

✍️ OpenClawRadar📅 Publicado: 14 de mayo de 2026🔗 Source
Historial de ELO del modelo Arena AI rastrea la degradación del rendimiento de LLM a lo largo del tiempo
Ad

El Historial ELO de Modelos de IA de Arena de Erwin Mayer (seguimiento en vivo) traza las puntuaciones ELO históricas del ranking de LMSYS Arena para exponer las tendencias de rendimiento de los modelos insignia de IA. La idea central: los modelos que se sienten geniales al lanzarse a menudo se degradan semanas después debido a actualizaciones silenciosas, cuantización o cambios en los envoltorios de seguridad.

Características principales

  • Una curva por laboratorio: En lugar de un gráfico enmarañado de cada variante, cada laboratorio importante de IA obtiene una única línea continua que representa su modelo insignia mejor valorado en cualquier momento.
  • Lógica de seguimiento insignia: La curva se adhiere al modelo de primer nivel (por ejemplo, Opus permanece activo hasta que aparece un nuevo modelo con mayor puntuación). Lanzamientos de gama media como Sonnet no provocan un salto mientras Opus lidera.
  • Modos de inferencia combinados: Sufijos como -thinking, -reasoning, -high se fusionan con el modelo base para evitar cambios constantes.
  • Marcadores de nuevos lanzamientos: Los lanzamientos se muestran como puntos etiquetados, generalmente acompañados de saltos en la puntuación.
  • Degradación visible: Las tendencias a la baja dentro del ciclo de vida de un modelo entre lanzamientos se trazan claramente.
  • Compatible con móviles y modo oscuro incluidos.
Ad

Fuente de datos

Los datos se obtienen automáticamente a diario del conjunto de datos oficial de LMSYS Arena en Hugging Face. El Arena utiliza miles de evaluaciones humanas ciegas y colaborativas a través de endpoints de API, no interfaces web de consumo.

Punto ciego crítico: interfaz web vs. API

El autor reconoce una limitación clave: LMSYS prueba modelos API sin procesar. Las interfaces de consumo (chatgpt.com, gemini.com) añaden prompts de sistema pesados, envoltorios de seguridad y pueden cambiar silenciosamente a modelos cuantizados bajo carga. El proyecto busca conjuntos de datos históricos de ELO o evaluaciones de interfaces web reales para capturar la "degradación" que experimentan los usuarios. Se aceptan pull requests con dichos conjuntos de datos (enlace al repositorio en el pie de página).

Para quién es

Desarrolladores e investigadores que rastrean la calidad de los modelos de lenguaje a lo largo del tiempo, especialmente aquellos que despliegan agentes de IA que dependen de un comportamiento consistente del modelo.

📖 Leer la fuente completa: HN LLM Tools

Ad

👀 Ver también

Engramx v3.4: MCP Server + Grafo de Conocimiento SQLite Reduce el Uso de Tokens de Claude Code en un 89%
Herramientas

Engramx v3.4: MCP Server + Grafo de Conocimiento SQLite Reduce el Uso de Tokens de Claude Code en un 89%

Engramx v3.4 intercepta las lecturas de archivos para los agentes de Claude Code, devolviendo resúmenes estructurales en lugar del contenido bruto. Los benchmarks muestran una reducción agregada de tokens del 89.1% en una base de código de 87 archivos.

OpenClawRadar
Charlas Directas: Una Habilidad de Código Abierto para Claude que Exige Retroalimentación Honesta, No Validación
Herramientas

Charlas Directas: Una Habilidad de Código Abierto para Claude que Exige Retroalimentación Honesta, No Validación

Una nueva habilidad de Claude de código abierto llamada Straight Talk hace que Claude se niegue a validar ideas hasta que entienda la situación, luego genera contraargumentos y pone a prueba las suposiciones.

OpenClawRadar
Agente Refugio Seguro: Sandboxing nativo de macOS para agentes de IA de codificación local
Herramientas

Agente Refugio Seguro: Sandboxing nativo de macOS para agentes de IA de codificación local

Agent Safehouse es una herramienta de aislamiento nativa para macOS que evita que los agentes de IA locales accedan a archivos fuera del directorio de tu proyecto mediante aplicación a nivel de kernel. Es un único script de shell sin dependencias que funciona con Claude Code, Codex, OpenCode, Amp, Gemini CLI, Aider, Goose, Auggie, Pi, Cursor Agent, Cline, Kilo, Code Droid y otros agentes.

OpenClawRadar
Pleng: Plataforma en la Nube Autohospedada con Gestión de Infraestructura Impulsada por IA
Herramientas

Pleng: Plataforma en la Nube Autohospedada con Gestión de Infraestructura Impulsada por IA

Pleng es una plataforma en la nube autohospedada con licencia AGPL-3.0 que utiliza un agente de IA (actualmente Claude) para gestionar la infraestructura mediante comandos de bot de Telegram. Despliega desde repositorios de GitHub o directorios locales con enrutamiento Traefik automatizado, SSL de Let's Encrypt y análisis básicos.

OpenClawRadar