История рейтинга ELO модели Arena AI отслеживает снижение производительности LLM с течением времени

✍️ OpenClawRadar📅 Опубликовано: 14 мая 2026 г.🔗 Source
История рейтинга ELO модели Arena AI отслеживает снижение производительности LLM с течением времени
Ad

История ELO моделей AI Arena от Erwin Mayer (живой трекер) отображает исторические рейтинги ELO из таблицы лидеров LMSYS Arena, выявляя тенденции производительности флагманских AI-моделей. Основное открытие: модели, которые кажутся отличными при запуске, часто деградируют через несколько недель из-за незаметных обновлений, квантизации или изменений в защитных обёртках.

Ключевые особенности

  • Одна кривая на лабораторию: Вместо спагетти-графика из множества вариантов, каждая крупная AI-лаборатория получает одну непрерывную линию, представляющую их самую высокорейтинговую флагманскую модель на текущий момент.
  • Логика отслеживания флагманов: Кривая привязана к топовой модели (например, Opus остаётся активной, пока не появится новая модель с более высоким рейтингом). Промежуточные релизы, такие как Sonnet, не вызывают скачка, пока лидирует Opus.
  • Слияние режимов инференса: Суффиксы вроде -thinking, -reasoning, -high сворачиваются в базовую модель, чтобы избежать переключений.
  • Маркеры новых релизов: Релизы отображаются как подписанные точки, обычно сопровождаемые скачками рейтинга.
  • Видимая деградация: Нисходящие тренды в жизненном цикле модели между релизами чётко отображаются.
  • Мобильная версия и тёмная тема включены.
Ad

Источник данных

Данные автоматически загружаются ежедневно из официального датасета LMSYS Arena на Hugging Face. Arena использует тысячи слепых краудсорсинговых человеческих оценок через API-эндпоинты, а не потребительские веб-интерфейсы.

Критическое слепое пятно: веб-интерфейс против API

Автор признаёт ключевое ограничение: LMSYS тестирует сырые API-модели. Потребительские интерфейсы (chatgpt.com, gemini.com) добавляют тяжёлые системные промпты, защитные обёртки и могут незаметно переключаться на квантизированные модели под нагрузкой. Проект ищет исторические данные ELO или оценок из реальных веб-интерфейсов, чтобы зафиксировать «ослабление», которое испытывают пользователи. PR с такими данными приветствуются (ссылка на репозиторий в подвале).

Для кого это

Для разработчиков и исследователей, отслеживающих качество LLM-моделей с течением времени, особенно для тех, кто разворачивает AI-агентов, полагающихся на стабильное поведение модели.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

mistral.rs 新增对 Gemma 4 12B 的支持:多模态、智能体与 MTP
Инструменты

mistral.rs 新增对 Gemma 4 12B 的支持:多模态、智能体与 MTP

mistral.rs теперь поддерживает Gemma 4 12B с мультимодальностью, агентными функциями и MTP. Установка в одну строку и запуск с веб-поиском, выполнением кода и встроенным интерфейсом.

OpenClawRadar
Портативный формат разума (PMF): Независимая от провайдера спецификация агентов с 15 открытыми агентами
Инструменты

Портативный формат разума (PMF): Независимая от провайдера спецификация агентов с 15 открытыми агентами

Portable Mind Format (PMF) — это спецификация на основе JSON для определения идентичностей ИИ-агентов, которые могут работать на различных моделях и платформах, включая Claude, GPT-4, Gemini, DeepSeek и локальные модели через Ollama. Включает 15 готовых агентов с лицензией MIT и конвертеры для Claude Code, Cursor, GitHub Copilot и Gemini CLI.

OpenClawRadar
Инструмент с открытым исходным кодом оценивает автономность ИИ-агентов для программирования с помощью локального анализа данных.
Инструменты

Инструмент с открытым исходным кодом оценивает автономность ИИ-агентов для программирования с помощью локального анализа данных.

Codelens-AI — это инструмент с открытым исходным кодом для командной строки, который анализирует файлы сессий Claude Code вместе с историей git, чтобы рассчитать метрики автономности, такие как коэффициент автопилота и показатель самовосстановления. Инструмент работает локально без настройки, используя npx claude-roi, и хранит все данные на вашем компьютере.

OpenClawRadar
Ory Lumen: Плагин с открытым исходным кодом для локального семантического поиска в Claude Code
Инструменты

Ory Lumen: Плагин с открытым исходным кодом для локального семантического поиска в Claude Code

Ory Lumen — это плагин для Claude Code, который индексирует кодовые базы с использованием Ollama с моделью векторного представления кода и SQLite-vec для семантического поиска, решая проблемы производительности Claude Code при работе с большими кодовыми базами. Инструмент бесплатный, работает только локально и включает в себя тестовый набор в стиле SWE для воспроизводимых результатов.

OpenClawRadar