Результаты тестирования небольших локальных моделей и моделей OpenRouter на задаче агентного преобразования текста в SQL

✍️ OpenClawRadar📅 Опубликовано: 17 апреля 2026 г.🔗 Source
Результаты тестирования небольших локальных моделей и моделей OpenRouter на задаче агентного преобразования текста в SQL
Ad

Разработчик опубликовал результаты бенчмарка для небольших локальных моделей и моделей OpenRouter в задаче агентного преобразования текста в SQL. Бенчмарк принимает английские запросы, такие как "Показать строки заказов, выручку, проданные единицы, выручку на единицу (общая выручка ÷ общее количество проданных единиц), среднюю цену по прейскуранту на продукт в подкатегории, валовую прибыль и процент маржи для каждой подкатегории продукта", и преобразует их в SQL, который тестируется на таблицах базы данных.

Детали бенчмарка

Агент может видеть результаты запросов и изменять SQL для исправления проблем, с ограничением на раунды отладки. Бенчмарк намеренно короткий — 25 вопросов — и выполняется гораздо быстрее 5 минут для большинства моделей, что делает его практичным для тестирования различных конфигураций. Он разработан достаточно сложным, чтобы отделить лучшие модели от остальных.

Ad

Ключевые выводы

  • Лучшими открытыми моделями были признаны kimi-k2.5, Qwen 3.5 397B-A17B и Qwen 3.5 27B
  • NVIDIA Nemotron-Cascade-2-30B-A3B превосходит Qwen 3.5-35B-A3B и соответствует Codex 5.3
  • Mimo v2 Flash была описана как "настоящая жемчужина среди моделей"

Вариант для самостоятельного размещения

Бенчмарк теперь включает возможность запускать его самостоятельно на вашем собственном сервере с использованием WASM-версии Llama.cpp. Разработчик ищет обратную связь о том, что изменить для версии 2, и хочет увидеть оценки, которые получают другие с разными конфигурациями.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Octopoda: Открытый слой памяти для локальных ИИ-агентов
Инструменты

Octopoda: Открытый слой памяти для локальных ИИ-агентов

Octopoda — это открытый слой памяти, который предоставляет локальным ИИ-агентам постоянную память между сессиями, семантический поиск, обнаружение циклов и восстановление после сбоев. Работает полностью офлайн с 33-мегабайтной моделью эмбеддингов и интегрируется с LangChain, CrewAI, AutoGen и OpenAI Agents SDK.

OpenClawRadar
Инструмент границы утверждения для работы с репозиторием кода Claude
Инструменты

Инструмент границы утверждения для работы с репозиторием кода Claude

Разработчик создал инструмент для границы одобрения, который добавляет этап проверки перед локальным выполнением при использовании Claude Code для работы с репозиторием. Инструмент следует циклу: сначала увидеть план, одобрить один раз, позволить выполнению произойти локально и сохранить доказательство после этого.

OpenClawRadar
Почему ИИ-агенты для кода выдают мусор после 20 итераций: слепота к контексту
Инструменты

Почему ИИ-агенты для кода выдают мусор после 20 итераций: слепота к контексту

Глубокий аудит API-логов показывает, что Cursor и Claude Code не глупеют — они задыхаются в раздутых контекстных окнах, заполненных шумом, что приводит к разрушению архитектуры.

OpenClawRadar
Создание локального голосового AI-ассистента с помощью SwiftUI и CSM-1B на Apple Silicon
Инструменты

Создание локального голосового AI-ассистента с помощью SwiftUI и CSM-1B на Apple Silicon

Разработчик создал mobiGlas, приложение на SwiftUI, которое объединяется с OpenClaw для возможности разговоров без рук через AirPods, используя локальное клонирование голоса (CSM-1B на M2 Ultra) и без облачных API.

OpenClawRadar