本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比

✍️ OpenClawRadar📅 Опубликовано: 3 мая 2026 г.🔗 Source
本地LLM基准测试:通过函数调用生成后端——GLM、Qwen、DeepSeek对比
Ad

Спустя пять месяцев после первоначального неконтролируемого замера AutoBe.dev опубликовал полноценный бенчмарк локальных и frontier LLM для генерации бэкенд-кода с использованием вызова функций. Бенчмарк использует контролируемые переменные и реальную оценочную рубрику, тестируя модели на генерацию рекурсивно-объединенных AST-схем через обвязку вызова функций.

Ключевые выводы

  • Обвязка вызова функций практически устранила разрыв между frontier и локальными моделями в генерации бэкенда. В частности, оценки gpt-5.4 по проектированию БД/API примерно равны qwen3.5-35b-a3b, а оценки логики claude-sonnet-4.6 соответствуют qwen3.5-27b.
  • Это последний раунд с включением frontier моделей. Ежемесячный прогон обходится в ~200–300 млн токенов (~$1,000–$1,500 за модель по ценам GPT 5.5). Со следующего месяца будут включены только конечные точки OpenRouter дешевле $0,25/млн токенов или модели, помещающиеся на 64-ГБ ноутбук с унифицированной памятью.
  • Автоматизация фронтенда будет добавлена в бенчмарк в раунде июнь/июль с использованием SDK, который AutoBe уже генерирует для сквозного создания AI-фронтендов (визуал грубый, но все функции работают).
Ad

Неожиданные инверсии

Несколько результатов еще исследуются:

  • openai/gpt-5.4 показывает результаты ниже своего же mini-собрата.
  • deepseek-v4-pro оказывается на одну ступень ниже qwen3.5-35b-a3b и едва отрывается от своего Flash-собрата.
  • В семействе Qwen плотная 27B превосходит все варианты MoE, включая 397B-A17B.

Возможные объяснения, которые изучаются, включают феномен соблюдения CoT (крупные/frontier модели склонны пропускать процедурные инструкции, навязываемые обвязкой) и дефекты бенчмарка (n=4 эталонных проекта, узкий диапазон оценок, обвязка оценивает собственный конвейер).

Рекомендуемые модели

Три утвержденных кандидата на следующий месяц:

  • openai/gpt-5.4-nano — $0,25/млн токенов
  • qwen/qwen3.6-27b — $0,195/млн токенов
  • deepseek/deepseek-v4-flash — $0,14/млн токенов

Все они дешевле $0,25/млн на OpenRouter или запускаемы на 64-ГБ ноутбуке с унифицированной памятью и корректно работают с вызовом функций.

Ссылки

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Встреча Министерства обороны США с Anthropic и дистилляция Claude в китайских лабораториях ИИ
Новости

Встреча Министерства обороны США с Anthropic и дистилляция Claude в китайских лабораториях ИИ

Генеральный директор Anthropic встречается с министром обороны США в ситуации, которую официальные лица описывают как «исправляйся или уходи», в то время как компания сообщает о поимке трёх китайских лабораторий ИИ, занимающихся массовым дистилляцией возможностей Claude.

OpenClawRadar
Системные промпты Claude Code версии 2.1.51/52: Новые промпты, обновления SDK и функции общего доступа
Новости

Системные промпты Claude Code версии 2.1.51/52: Новые промпты, обновления SDK и функции общего доступа

В версиях 2.1.51 и 2.1.52 Claude Code добавлены шесть новых системных промптов, обновлены ссылки на SDK/API для семи языков программирования, а функции выполнения кода и памяти переведены в статус общедоступности. Python Agent SDK был переработан с изменениями в асинхронности и новыми интерфейсами.

OpenClawRadar
Первый шаг к ИИ общего назначения: преодоление разрыва с ClawDBot
Новости

Первый шаг к ИИ общего назначения: преодоление разрыва с ClawDBot

Изучите, как ClawDBot продвигает нас к общему искусственному интеллекту (AGI), совершенствуя AI-агентов по программированию, демонстрируя важный шаг в эволюции ИИ.

OpenClawRadar
Текущее состояние китайских больших языковых моделей: лидеры рынка, открытые модели и бизнес-модели
Новости

Текущее состояние китайских больших языковых моделей: лидеры рынка, открытые модели и бизнес-модели

Анализ на Reddit описывает ландшафт китайских больших языковых моделей (LLM), определяя Doubao от ByteDance как лидера на рынке проприетарных моделей, а DeepSeek — как самую инновационную компанию. В отчёте также изложены бизнес-модели основных игроков и «Шести AI-тигрят», которые сосредоточены на моделях с открытыми весами.

OpenClawRadar