Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.

Результаты тестирования и анализ
Gemma 4 31B заняла 3-е место в тесте FoodTruck Bench, превзойдя несколько более крупных и известных моделей. Согласно обсуждению на Reddit, модель обошла GLM 5, Qwen 3.5 397B и все варианты Claude Sonnet.
FoodTruck Bench — это тест, который проверяет языковые модели на сложных многоэтапных задачах планирования. Автор исходного поста предполагает, что результаты Gemma 4 указывают на то, что она лучше справляется с долгосрочными задачами, чем предыдущие модели, которые не смогли пройти тест. В частности, модель, по-видимому, эффективно прислушивается к собственным рекомендациям при планировании последующих шагов в последовательности задач.
Этот результат примечателен, поскольку Gemma 4 31B значительно меньше некоторых моделей, которые она превзошла. Например, Qwen 3.5 397B имеет примерно в 12,8 раз больше параметров, чем Gemma 4 31B. Результаты показывают, что архитектура модели и подходы к обучению могут быть столь же важны, как и количество параметров, для определённых типов задач на логическое мышление.
FoodTruck Bench тестирует модели на практических сценариях планирования, требующих сохранения контекста в течение длинных последовательностей действий. Дизайн теста делает его особенно актуальным для разработчиков, работающих с ИИ-агентами, которым необходимо выполнять многоэтапные задачи в реальных приложениях.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

В ИИ 41% зависит от -59%
Главный экономист Apollo разбирает норму прибыли в ИИ по слоям цепочки создания стоимости: модели и приложения убыточны на 59%, тогда как производство чипов и оборудования приносит 41%. Бум финансируется инвесторами, а не клиентами.

Агенты OpenClaw соревнуются в Лиге Pokémon Red, доступной только для искусственного интеллекта.
Новая платформа под названием AgentMonLeague позволяет автономным агентам OpenClaw подключаться к эмулятору Pokémon Red, самостоятельно принимать решения на протяжении всей игры и соревноваться, чтобы первыми её завершить. Прохождение можно наблюдать в реальном времени по мере продвижения агентов.

Искусственный интеллект не смог повысить продуктивность, согласно недавнему исследованию CEOs.
Несмотря на широкое внедрение ИИ, исследование 6000 руководителей сообщает о незначительных влияниях на производительность и занятость, что перекликается с парадоксом производительности, выявленным в эпоху ИТ 1980-х годов.

От подсказок к проектированию спецификаций: переход к архитектуре «Планировщик-Исполнитель»
Развитие ИИ смещается от простого чатового взаимодействия к архитектуре планировщик-исполнитель, где люди выступают в роли инженеров спецификаций. Это требует определения строгих критериев приемки, архитектуры ограничений и паттернов декомпозиции для автономных агентов ИИ.