Результаты тестирования небольших локальных моделей и моделей OpenRouter на задаче агентного преобразования текста в SQL

Разработчик опубликовал результаты бенчмарка для небольших локальных моделей и моделей OpenRouter в задаче агентного преобразования текста в SQL. Бенчмарк принимает английские запросы, такие как "Показать строки заказов, выручку, проданные единицы, выручку на единицу (общая выручка ÷ общее количество проданных единиц), среднюю цену по прейскуранту на продукт в подкатегории, валовую прибыль и процент маржи для каждой подкатегории продукта", и преобразует их в SQL, который тестируется на таблицах базы данных.
Детали бенчмарка
Агент может видеть результаты запросов и изменять SQL для исправления проблем, с ограничением на раунды отладки. Бенчмарк намеренно короткий — 25 вопросов — и выполняется гораздо быстрее 5 минут для большинства моделей, что делает его практичным для тестирования различных конфигураций. Он разработан достаточно сложным, чтобы отделить лучшие модели от остальных.
Ключевые выводы
- Лучшими открытыми моделями были признаны kimi-k2.5, Qwen 3.5 397B-A17B и Qwen 3.5 27B
- NVIDIA Nemotron-Cascade-2-30B-A3B превосходит Qwen 3.5-35B-A3B и соответствует Codex 5.3
- Mimo v2 Flash была описана как "настоящая жемчужина среди моделей"
Вариант для самостоятельного размещения
Бенчмарк теперь включает возможность запускать его самостоятельно на вашем собственном сервере с использованием WASM-версии Llama.cpp. Разработчик ищет обратную связь о том, что изменить для версии 2, и хочет увидеть оценки, которые получают другие с разными конфигурациями.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Octopoda: Открытый слой памяти для локальных ИИ-агентов
Octopoda — это открытый слой памяти, который предоставляет локальным ИИ-агентам постоянную память между сессиями, семантический поиск, обнаружение циклов и восстановление после сбоев. Работает полностью офлайн с 33-мегабайтной моделью эмбеддингов и интегрируется с LangChain, CrewAI, AutoGen и OpenAI Agents SDK.

Инструмент границы утверждения для работы с репозиторием кода Claude
Разработчик создал инструмент для границы одобрения, который добавляет этап проверки перед локальным выполнением при использовании Claude Code для работы с репозиторием. Инструмент следует циклу: сначала увидеть план, одобрить один раз, позволить выполнению произойти локально и сохранить доказательство после этого.

Почему ИИ-агенты для кода выдают мусор после 20 итераций: слепота к контексту
Глубокий аудит API-логов показывает, что Cursor и Claude Code не глупеют — они задыхаются в раздутых контекстных окнах, заполненных шумом, что приводит к разрушению архитектуры.

Создание локального голосового AI-ассистента с помощью SwiftUI и CSM-1B на Apple Silicon
Разработчик создал mobiGlas, приложение на SwiftUI, которое объединяется с OpenClaw для возможности разговоров без рук через AirPods, используя локальное клонирование голоса (CSM-1B на M2 Ultra) и без облачных API.