История рейтинга ELO модели Arena AI отслеживает снижение производительности LLM с течением времени

История ELO моделей AI Arena от Erwin Mayer (живой трекер) отображает исторические рейтинги ELO из таблицы лидеров LMSYS Arena, выявляя тенденции производительности флагманских AI-моделей. Основное открытие: модели, которые кажутся отличными при запуске, часто деградируют через несколько недель из-за незаметных обновлений, квантизации или изменений в защитных обёртках.
Ключевые особенности
- Одна кривая на лабораторию: Вместо спагетти-графика из множества вариантов, каждая крупная AI-лаборатория получает одну непрерывную линию, представляющую их самую высокорейтинговую флагманскую модель на текущий момент.
- Логика отслеживания флагманов: Кривая привязана к топовой модели (например, Opus остаётся активной, пока не появится новая модель с более высоким рейтингом). Промежуточные релизы, такие как Sonnet, не вызывают скачка, пока лидирует Opus.
- Слияние режимов инференса: Суффиксы вроде
-thinking,-reasoning,-highсворачиваются в базовую модель, чтобы избежать переключений. - Маркеры новых релизов: Релизы отображаются как подписанные точки, обычно сопровождаемые скачками рейтинга.
- Видимая деградация: Нисходящие тренды в жизненном цикле модели между релизами чётко отображаются.
- Мобильная версия и тёмная тема включены.
Источник данных
Данные автоматически загружаются ежедневно из официального датасета LMSYS Arena на Hugging Face. Arena использует тысячи слепых краудсорсинговых человеческих оценок через API-эндпоинты, а не потребительские веб-интерфейсы.
Критическое слепое пятно: веб-интерфейс против API
Автор признаёт ключевое ограничение: LMSYS тестирует сырые API-модели. Потребительские интерфейсы (chatgpt.com, gemini.com) добавляют тяжёлые системные промпты, защитные обёртки и могут незаметно переключаться на квантизированные модели под нагрузкой. Проект ищет исторические данные ELO или оценок из реальных веб-интерфейсов, чтобы зафиксировать «ослабление», которое испытывают пользователи. PR с такими данными приветствуются (ссылка на репозиторий в подвале).
Для кого это
Для разработчиков и исследователей, отслеживающих качество LLM-моделей с течением времени, особенно для тех, кто разворачивает AI-агентов, полагающихся на стабильное поведение модели.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Временная сложность MCP: Инструмент статического анализа передает сложность Big-O ИИ-агентам для написания кода
Time Complexity MCP — это сервер MCP с открытым исходным кодом, который выполняет статический анализ кода для определения временной сложности Big-O и передаёт результаты напрямую AI-агентам для написания кода, таким как Claude Code или Copilot, без потребления токенов. Поддерживает JavaScript, TypeScript, Python, Java, Kotlin и Dart.

Как Claude маркирует AI-сгенерированный контент: водяные знаки и раскрытие информации
Claude помечает контент, созданный ИИ, водяными знаками и метаданными, чтобы обеспечить прозрачность и происхождение в выводах ИИ.

js-notepad: Скриптуемый блокнот со встроенным MCP-сервером для кода Claude
js-notepad — это бесплатное приложение с открытым исходным кодом для создания скриптуемых блокнотов, разработанное с помощью Claude Code. Оно включает встроенный MCP-сервер, позволяющий Claude Code напрямую взаимодействовать с приложением для чтения/записи страниц, выполнения скриптов, создания задач и отправки результатов.

Открытый ассистент JARVIS для рабочего стола, созданный с помощью Claude Code за 2 дня
Разработчик создал настольный ИИ-ассистент для macOS под названием JARVIS за 1-2 дня, используя Claude Code в качестве основного инструмента разработки. Приложение имеет голографический интерфейс, 18 встроенных инструментов для управления системой, голосовое управление и интеграции с Gmail, Google Calendar, Notion, GitHub и Obsidian.