本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比

✍️ OpenClawRadar📅 Опубликовано: 3 мая 2026 г.🔗 Source
本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比
Ad

Спустя пять месяцев после первоначального неконтролируемого замера AutoBe.dev опубликовал полноценный бенчмарк локальных и frontier LLM для генерации бэкенд-кода с использованием вызова функций. Бенчмарк использует контролируемые переменные и реальную оценочную рубрику, тестируя модели на генерацию рекурсивно-объединенных AST-схем через обвязку вызова функций.

Ключевые выводы

  • Обвязка вызова функций практически устранила разрыв между frontier и локальными моделями в генерации бэкенда. В частности, оценки gpt-5.4 по проектированию БД/API примерно равны qwen3.5-35b-a3b, а оценки логики claude-sonnet-4.6 соответствуют qwen3.5-27b.
  • Это последний раунд с включением frontier моделей. Ежемесячный прогон обходится в ~200–300 млн токенов (~$1,000–$1,500 за модель по ценам GPT 5.5). Со следующего месяца будут включены только конечные точки OpenRouter дешевле $0,25/млн токенов или модели, помещающиеся на 64-ГБ ноутбук с унифицированной памятью.
  • Автоматизация фронтенда будет добавлена в бенчмарк в раунде июнь/июль с использованием SDK, который AutoBe уже генерирует для сквозного создания AI-фронтендов (визуал грубый, но все функции работают).
Ad

Неожиданные инверсии

Несколько результатов еще исследуются:

  • openai/gpt-5.4 показывает результаты ниже своего же mini-собрата.
  • deepseek-v4-pro оказывается на одну ступень ниже qwen3.5-35b-a3b и едва отрывается от своего Flash-собрата.
  • В семействе Qwen плотная 27B превосходит все варианты MoE, включая 397B-A17B.

Возможные объяснения, которые изучаются, включают феномен соблюдения CoT (крупные/frontier модели склонны пропускать процедурные инструкции, навязываемые обвязкой) и дефекты бенчмарка (n=4 эталонных проекта, узкий диапазон оценок, обвязка оценивает собственный конвейер).

Рекомендуемые модели

Три утвержденных кандидата на следующий месяц:

  • openai/gpt-5.4-nano — $0,25/млн токенов
  • qwen/qwen3.6-27b — $0,195/млн токенов
  • deepseek/deepseek-v4-flash — $0,14/млн токенов

Все они дешевле $0,25/млн на OpenRouter или запускаемы на 64-ГБ ноутбуке с унифицированной памятью и корректно работают с вызовом функций.

Ссылки

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

🦀
Новости

Opus 4.7 может следовать ~500 инструкциям, по сравнению с ~150 год назад

Исследование, обновленное в мае 2026 года, показывает, что Opus 4.7 может надежно следовать примерно 500 инструкциям, по сравнению с примерно 150 в июле 2025 года. GPT-5.5 справляется примерно с 5000. Последствия для размера файла CLAUDE.md.

OpenClawRadar
OpenAI развернет модели искусственного интеллекта в защищенной сети Министерства обороны США.
Новости

OpenAI развернет модели искусственного интеллекта в защищенной сети Министерства обороны США.

OpenAI достигла соглашения о развертывании своих моделей искусственного интеллекта в классифицированной сети Министерства обороны США, реализация запланирована на 2026 год. Статья Reuters набрала 15 баллов и 6 комментариев на Hacker News.

OpenClawRadar
Использование воды в центрах обработки данных ИИ в Калифорнии: оценки на основе физических и ИИ-моделей
Новости

Использование воды в центрах обработки данных ИИ в Калифорнии: оценки на основе физических и ИИ-моделей

Анализ California WaterBlog, использующий физику и четыре модели ИИ, оценивает потребление воды дата-центрами ИИ в Калифорнии в 2300–400 000 акро-футов в год, при реалистичном диапазоне 32 000–290 000 акро-футов в год — скромно по сравнению с сельским хозяйством.

OpenClawRadar
🦀
Новости

Открываем исходный код AstaBrief — быстрой модели генерации отчётов в Asta

Ai2 выпустила AstaBrief 8B — модель с открытыми весами, которая превращает исследовательский вопрос и выдержки из найденной литературы в отчёт с цитатами. В режиме Fast генерация занимает в среднем 51,1 секунды против 178,5 в режиме Thinking, а обучающие данные публикуются вместе с весами.

OpenClawRadar