Результаты тестирования небольших локальных моделей и моделей OpenRouter на задаче агентного преобразования текста в SQL

✍️ OpenClawRadar📅 Опубликовано: 17 апреля 2026 г.🔗 Source
Результаты тестирования небольших локальных моделей и моделей OpenRouter на задаче агентного преобразования текста в SQL
Ad

Разработчик опубликовал результаты бенчмарка для небольших локальных моделей и моделей OpenRouter в задаче агентного преобразования текста в SQL. Бенчмарк принимает английские запросы, такие как "Показать строки заказов, выручку, проданные единицы, выручку на единицу (общая выручка ÷ общее количество проданных единиц), среднюю цену по прейскуранту на продукт в подкатегории, валовую прибыль и процент маржи для каждой подкатегории продукта", и преобразует их в SQL, который тестируется на таблицах базы данных.

Детали бенчмарка

Агент может видеть результаты запросов и изменять SQL для исправления проблем, с ограничением на раунды отладки. Бенчмарк намеренно короткий — 25 вопросов — и выполняется гораздо быстрее 5 минут для большинства моделей, что делает его практичным для тестирования различных конфигураций. Он разработан достаточно сложным, чтобы отделить лучшие модели от остальных.

Ad

Ключевые выводы

  • Лучшими открытыми моделями были признаны kimi-k2.5, Qwen 3.5 397B-A17B и Qwen 3.5 27B
  • NVIDIA Nemotron-Cascade-2-30B-A3B превосходит Qwen 3.5-35B-A3B и соответствует Codex 5.3
  • Mimo v2 Flash была описана как "настоящая жемчужина среди моделей"

Вариант для самостоятельного размещения

Бенчмарк теперь включает возможность запускать его самостоятельно на вашем собственном сервере с использованием WASM-версии Llama.cpp. Разработчик ищет обратную связь о том, что изменить для версии 2, и хочет увидеть оценки, которые получают другие с разными конфигурациями.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Открытая курируемая коллекция ресурсов OpenClaw представлена.
Инструменты

Открытая курируемая коллекция ресурсов OpenClaw представлена.

Погрузитесь в новую открытую коллекцию ресурсов OpenClaw, составленную сообществом для улучшения разработки ИИ и сотрудничества.

OpenClawRadar
Claude-Code версии 2.1.111 добавляет Opus 4.7 с высоким уровнем усилий, функцию /ultrareview и инструмент PowerShell.
Инструменты

Claude-Code версии 2.1.111 добавляет Opus 4.7 с высоким уровнем усилий, функцию /ultrareview и инструмент PowerShell.

Claude-Code v2.1.111 представляет уровень усилий Opus 4.7 xhigh между high и max, добавляет команду /ultrareview для облачных многокомпонентных проверок кода и начинает внедрять поддержку инструментов PowerShell в Windows. Обновление также включает интерактивные элементы управления /effort, автоматическое соответствие темы и множество исправлений ошибок.

OpenClawRadar
Разработчик создаёт библиотеку сжатия на Rust с помощью Claude Opus 4.6, задаваясь вопросом о её практической пользе.
Инструменты

Разработчик создаёт библиотеку сжатия на Rust с помощью Claude Opus 4.6, задаваясь вопросом о её практической пользе.

Разработчик использовал Claude Opus 4.6 в течение двух недель для создания библиотеки сжатия на Rust объёмом 15 800 строк с 449 пройденными тестами, привязками для Python и слоем C FFI, но задаётся вопросом, нужна ли была ещё одна библиотека сжатия.

OpenClawRadar
Мозг: Постоянная система памяти ошибок для кода Claude через MCP
Инструменты

Мозг: Постоянная система памяти ошибок для кода Claude через MCP

Brain — это сервер MCP с открытым исходным кодом, который предоставляет Claude Code постоянную, межпроектную память об ошибках и их решениях. Он фиксирует контекст ошибок, предлагает проверенные исправления с оценкой уверенности и строит взвешенную синаптическую сеть, связывающую ошибки, решения и модули кода во всех проектах.

OpenClawRadar