本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比

Спустя пять месяцев после первоначального неконтролируемого замера AutoBe.dev опубликовал полноценный бенчмарк локальных и frontier LLM для генерации бэкенд-кода с использованием вызова функций. Бенчмарк использует контролируемые переменные и реальную оценочную рубрику, тестируя модели на генерацию рекурсивно-объединенных AST-схем через обвязку вызова функций.
Ключевые выводы
- Обвязка вызова функций практически устранила разрыв между frontier и локальными моделями в генерации бэкенда. В частности, оценки
gpt-5.4по проектированию БД/API примерно равныqwen3.5-35b-a3b, а оценки логикиclaude-sonnet-4.6соответствуютqwen3.5-27b. - Это последний раунд с включением frontier моделей. Ежемесячный прогон обходится в ~200–300 млн токенов (~$1,000–$1,500 за модель по ценам GPT 5.5). Со следующего месяца будут включены только конечные точки OpenRouter дешевле $0,25/млн токенов или модели, помещающиеся на 64-ГБ ноутбук с унифицированной памятью.
- Автоматизация фронтенда будет добавлена в бенчмарк в раунде июнь/июль с использованием SDK, который AutoBe уже генерирует для сквозного создания AI-фронтендов (визуал грубый, но все функции работают).
Неожиданные инверсии
Несколько результатов еще исследуются:
openai/gpt-5.4показывает результаты ниже своего жеmini-собрата.deepseek-v4-proоказывается на одну ступень нижеqwen3.5-35b-a3bи едва отрывается от своегоFlash-собрата.- В семействе Qwen плотная 27B превосходит все варианты MoE, включая 397B-A17B.
Возможные объяснения, которые изучаются, включают феномен соблюдения CoT (крупные/frontier модели склонны пропускать процедурные инструкции, навязываемые обвязкой) и дефекты бенчмарка (n=4 эталонных проекта, узкий диапазон оценок, обвязка оценивает собственный конвейер).
Рекомендуемые модели
Три утвержденных кандидата на следующий месяц:
openai/gpt-5.4-nano— $0,25/млн токеновqwen/qwen3.6-27b— $0,195/млн токеновdeepseek/deepseek-v4-flash— $0,14/млн токенов
Все они дешевле $0,25/млн на OpenRouter или запускаемы на 64-ГБ ноутбуке с унифицированной памятью и корректно работают с вызовом функций.
Ссылки
- Панель бенчмарка: https://autobe.dev/benchmark/
- Результаты генерации: GitHub: autobe-examples
- Репозиторий на GitHub: https://github.com/wrtnlabs/autobe
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также
Opus 4.7 может следовать ~500 инструкциям, по сравнению с ~150 год назад
Исследование, обновленное в мае 2026 года, показывает, что Opus 4.7 может надежно следовать примерно 500 инструкциям, по сравнению с примерно 150 в июле 2025 года. GPT-5.5 справляется примерно с 5000. Последствия для размера файла CLAUDE.md.

OpenAI развернет модели искусственного интеллекта в защищенной сети Министерства обороны США.
OpenAI достигла соглашения о развертывании своих моделей искусственного интеллекта в классифицированной сети Министерства обороны США, реализация запланирована на 2026 год. Статья Reuters набрала 15 баллов и 6 комментариев на Hacker News.

Использование воды в центрах обработки данных ИИ в Калифорнии: оценки на основе физических и ИИ-моделей
Анализ California WaterBlog, использующий физику и четыре модели ИИ, оценивает потребление воды дата-центрами ИИ в Калифорнии в 2300–400 000 акро-футов в год, при реалистичном диапазоне 32 000–290 000 акро-футов в год — скромно по сравнению с сельским хозяйством.
Открываем исходный код AstaBrief — быстрой модели генерации отчётов в Asta
Ai2 выпустила AstaBrief 8B — модель с открытыми весами, которая превращает исследовательский вопрос и выдержки из найденной литературы в отчёт с цитатами. В режиме Fast генерация занимает в среднем 51,1 секунды против 178,5 в режиме Thinking, а обучающие данные публикуются вместе с весами.