Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.

✍️ OpenClawRadar📅 Опубликовано: 21 апреля 2026 г.🔗 Source
Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.
Ad
Ad

Результаты тестирования и анализ

Gemma 4 31B заняла 3-е место в тесте FoodTruck Bench, превзойдя несколько более крупных и известных моделей. Согласно обсуждению на Reddit, модель обошла GLM 5, Qwen 3.5 397B и все варианты Claude Sonnet.

FoodTruck Bench — это тест, который проверяет языковые модели на сложных многоэтапных задачах планирования. Автор исходного поста предполагает, что результаты Gemma 4 указывают на то, что она лучше справляется с долгосрочными задачами, чем предыдущие модели, которые не смогли пройти тест. В частности, модель, по-видимому, эффективно прислушивается к собственным рекомендациям при планировании последующих шагов в последовательности задач.

Этот результат примечателен, поскольку Gemma 4 31B значительно меньше некоторых моделей, которые она превзошла. Например, Qwen 3.5 397B имеет примерно в 12,8 раз больше параметров, чем Gemma 4 31B. Результаты показывают, что архитектура модели и подходы к обучению могут быть столь же важны, как и количество параметров, для определённых типов задач на логическое мышление.

FoodTruck Bench тестирует модели на практических сценариях планирования, требующих сохранения контекста в течение длинных последовательностей действий. Дизайн теста делает его особенно актуальным для разработчиков, работающих с ИИ-агентами, которым необходимо выполнять многоэтапные задачи в реальных приложениях.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

В ИИ 41% зависит от -59%
Новости

В ИИ 41% зависит от -59%

Главный экономист Apollo разбирает норму прибыли в ИИ по слоям цепочки создания стоимости: модели и приложения убыточны на 59%, тогда как производство чипов и оборудования приносит 41%. Бум финансируется инвесторами, а не клиентами.

OpenClawRadar
Агенты OpenClaw соревнуются в Лиге Pokémon Red, доступной только для искусственного интеллекта.
Новости

Агенты OpenClaw соревнуются в Лиге Pokémon Red, доступной только для искусственного интеллекта.

Новая платформа под названием AgentMonLeague позволяет автономным агентам OpenClaw подключаться к эмулятору Pokémon Red, самостоятельно принимать решения на протяжении всей игры и соревноваться, чтобы первыми её завершить. Прохождение можно наблюдать в реальном времени по мере продвижения агентов.

OpenClawRadar
Искусственный интеллект не смог повысить продуктивность, согласно недавнему исследованию CEOs.
Новости

Искусственный интеллект не смог повысить продуктивность, согласно недавнему исследованию CEOs.

Несмотря на широкое внедрение ИИ, исследование 6000 руководителей сообщает о незначительных влияниях на производительность и занятость, что перекликается с парадоксом производительности, выявленным в эпоху ИТ 1980-х годов.

OpenClawRadar
От подсказок к проектированию спецификаций: переход к архитектуре «Планировщик-Исполнитель»
Новости

От подсказок к проектированию спецификаций: переход к архитектуре «Планировщик-Исполнитель»

Развитие ИИ смещается от простого чатового взаимодействия к архитектуре планировщик-исполнитель, где люди выступают в роли инженеров спецификаций. Это требует определения строгих критериев приемки, архитектуры ограничений и паттернов декомпозиции для автономных агентов ИИ.

OpenClawRadar