Результаты тестирования небольших локальных моделей и моделей OpenRouter на задаче агентного преобразования текста в SQL

Разработчик опубликовал результаты бенчмарка для небольших локальных моделей и моделей OpenRouter в задаче агентного преобразования текста в SQL. Бенчмарк принимает английские запросы, такие как "Показать строки заказов, выручку, проданные единицы, выручку на единицу (общая выручка ÷ общее количество проданных единиц), среднюю цену по прейскуранту на продукт в подкатегории, валовую прибыль и процент маржи для каждой подкатегории продукта", и преобразует их в SQL, который тестируется на таблицах базы данных.
Детали бенчмарка
Агент может видеть результаты запросов и изменять SQL для исправления проблем, с ограничением на раунды отладки. Бенчмарк намеренно короткий — 25 вопросов — и выполняется гораздо быстрее 5 минут для большинства моделей, что делает его практичным для тестирования различных конфигураций. Он разработан достаточно сложным, чтобы отделить лучшие модели от остальных.
Ключевые выводы
- Лучшими открытыми моделями были признаны kimi-k2.5, Qwen 3.5 397B-A17B и Qwen 3.5 27B
- NVIDIA Nemotron-Cascade-2-30B-A3B превосходит Qwen 3.5-35B-A3B и соответствует Codex 5.3
- Mimo v2 Flash была описана как "настоящая жемчужина среди моделей"
Вариант для самостоятельного размещения
Бенчмарк теперь включает возможность запускать его самостоятельно на вашем собственном сервере с использованием WASM-версии Llama.cpp. Разработчик ищет обратную связь о том, что изменить для версии 2, и хочет увидеть оценки, которые получают другие с разными конфигурациями.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Открытая курируемая коллекция ресурсов OpenClaw представлена.
Погрузитесь в новую открытую коллекцию ресурсов OpenClaw, составленную сообществом для улучшения разработки ИИ и сотрудничества.

Claude-Code версии 2.1.111 добавляет Opus 4.7 с высоким уровнем усилий, функцию /ultrareview и инструмент PowerShell.
Claude-Code v2.1.111 представляет уровень усилий Opus 4.7 xhigh между high и max, добавляет команду /ultrareview для облачных многокомпонентных проверок кода и начинает внедрять поддержку инструментов PowerShell в Windows. Обновление также включает интерактивные элементы управления /effort, автоматическое соответствие темы и множество исправлений ошибок.

Разработчик создаёт библиотеку сжатия на Rust с помощью Claude Opus 4.6, задаваясь вопросом о её практической пользе.
Разработчик использовал Claude Opus 4.6 в течение двух недель для создания библиотеки сжатия на Rust объёмом 15 800 строк с 449 пройденными тестами, привязками для Python и слоем C FFI, но задаётся вопросом, нужна ли была ещё одна библиотека сжатия.

Мозг: Постоянная система памяти ошибок для кода Claude через MCP
Brain — это сервер MCP с открытым исходным кодом, который предоставляет Claude Code постоянную, межпроектную память об ошибках и их решениях. Он фиксирует контекст ошибок, предлагает проверенные исправления с оценкой уверенности и строит взвешенную синаптическую сеть, связывающую ошибки, решения и модули кода во всех проектах.