本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比

Спустя пять месяцев после первоначального неконтролируемого замера AutoBe.dev опубликовал полноценный бенчмарк локальных и frontier LLM для генерации бэкенд-кода с использованием вызова функций. Бенчмарк использует контролируемые переменные и реальную оценочную рубрику, тестируя модели на генерацию рекурсивно-объединенных AST-схем через обвязку вызова функций.
Ключевые выводы
- Обвязка вызова функций практически устранила разрыв между frontier и локальными моделями в генерации бэкенда. В частности, оценки
gpt-5.4по проектированию БД/API примерно равныqwen3.5-35b-a3b, а оценки логикиclaude-sonnet-4.6соответствуютqwen3.5-27b. - Это последний раунд с включением frontier моделей. Ежемесячный прогон обходится в ~200–300 млн токенов (~$1,000–$1,500 за модель по ценам GPT 5.5). Со следующего месяца будут включены только конечные точки OpenRouter дешевле $0,25/млн токенов или модели, помещающиеся на 64-ГБ ноутбук с унифицированной памятью.
- Автоматизация фронтенда будет добавлена в бенчмарк в раунде июнь/июль с использованием SDK, который AutoBe уже генерирует для сквозного создания AI-фронтендов (визуал грубый, но все функции работают).
Неожиданные инверсии
Несколько результатов еще исследуются:
openai/gpt-5.4показывает результаты ниже своего жеmini-собрата.deepseek-v4-proоказывается на одну ступень нижеqwen3.5-35b-a3bи едва отрывается от своегоFlash-собрата.- В семействе Qwen плотная 27B превосходит все варианты MoE, включая 397B-A17B.
Возможные объяснения, которые изучаются, включают феномен соблюдения CoT (крупные/frontier модели склонны пропускать процедурные инструкции, навязываемые обвязкой) и дефекты бенчмарка (n=4 эталонных проекта, узкий диапазон оценок, обвязка оценивает собственный конвейер).
Рекомендуемые модели
Три утвержденных кандидата на следующий месяц:
openai/gpt-5.4-nano— $0,25/млн токеновqwen/qwen3.6-27b— $0,195/млн токеновdeepseek/deepseek-v4-flash— $0,14/млн токенов
Все они дешевле $0,25/млн на OpenRouter или запускаемы на 64-ГБ ноутбуке с унифицированной памятью и корректно работают с вызовом функций.
Ссылки
- Панель бенчмарка: https://autobe.dev/benchmark/
- Результаты генерации: GitHub: autobe-examples
- Репозиторий на GitHub: https://github.com/wrtnlabs/autobe
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Встреча Министерства обороны США с Anthropic и дистилляция Claude в китайских лабораториях ИИ
Генеральный директор Anthropic встречается с министром обороны США в ситуации, которую официальные лица описывают как «исправляйся или уходи», в то время как компания сообщает о поимке трёх китайских лабораторий ИИ, занимающихся массовым дистилляцией возможностей Claude.

Системные промпты Claude Code версии 2.1.51/52: Новые промпты, обновления SDK и функции общего доступа
В версиях 2.1.51 и 2.1.52 Claude Code добавлены шесть новых системных промптов, обновлены ссылки на SDK/API для семи языков программирования, а функции выполнения кода и памяти переведены в статус общедоступности. Python Agent SDK был переработан с изменениями в асинхронности и новыми интерфейсами.

Первый шаг к ИИ общего назначения: преодоление разрыва с ClawDBot
Изучите, как ClawDBot продвигает нас к общему искусственному интеллекту (AGI), совершенствуя AI-агентов по программированию, демонстрируя важный шаг в эволюции ИИ.

Текущее состояние китайских больших языковых моделей: лидеры рынка, открытые модели и бизнес-модели
Анализ на Reddit описывает ландшафт китайских больших языковых моделей (LLM), определяя Doubao от ByteDance как лидера на рынке проприетарных моделей, а DeepSeek — как самую инновационную компанию. В отчёте также изложены бизнес-модели основных игроков и «Шести AI-тигрят», которые сосредоточены на моделях с открытыми весами.