Gemma 4 31B превосходит более крупные модели на тесте FoodTruck Bench.

Результаты тестирования и анализ
Gemma 4 31B заняла 3-е место в тесте FoodTruck Bench, превзойдя несколько более крупных и известных моделей. Согласно обсуждению на Reddit, модель обошла GLM 5, Qwen 3.5 397B и все варианты Claude Sonnet.
FoodTruck Bench — это тест, который проверяет языковые модели на сложных многоэтапных задачах планирования. Автор исходного поста предполагает, что результаты Gemma 4 указывают на то, что она лучше справляется с долгосрочными задачами, чем предыдущие модели, которые не смогли пройти тест. В частности, модель, по-видимому, эффективно прислушивается к собственным рекомендациям при планировании последующих шагов в последовательности задач.
Этот результат примечателен, поскольку Gemma 4 31B значительно меньше некоторых моделей, которые она превзошла. Например, Qwen 3.5 397B имеет примерно в 12,8 раз больше параметров, чем Gemma 4 31B. Результаты показывают, что архитектура модели и подходы к обучению могут быть столь же важны, как и количество параметров, для определённых типов задач на логическое мышление.
FoodTruck Bench тестирует модели на практических сценариях планирования, требующих сохранения контекста в течение длинных последовательностей действий. Дизайн теста делает его особенно актуальным для разработчиков, работающих с ИИ-агентами, которым необходимо выполнять многоэтапные задачи в реальных приложениях.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также
Сотрудники Amazon используют AI-агентов MeshClaw для «токенмаксинга» с целью достижения показателей использования
Разработчики Amazon автоматизируют ненужные задачи с помощью внутреннего инструмента MeshClaw, чтобы накрутить потребление токенов ИИ, после того как компания установила еженедельные цели использования для 80% разработчиков и ввела внутренние рейтинги.

Обновление статуса: Claude Sonnet 4.5 испытывает повышенное количество ошибок
Claude Sonnet 4.5 в настоящее время испытывает повышенные ошибки по состоянию на 2026-04-28T13:29:56.000Z. Следите за обновлениями на странице статуса и в мегатреде Reddit.

Невыразимый интеллект Дэвида Сильвера привлек $1,1 млрд для суперобучающегося на основе RL без использования человеческих данных
Ineffable Intelligence, основанная выпускником DeepMind Дэвидом Сильвером, привлекла $1,1 млрд при оценке в $5,1 млрд для создания 'суперобучающегося' на основе обучения с подкреплением, который открывает знания без данных человека.

Пользователи OpenClaw жалуются на высокие затраты на API из-за расплывчатых запросов, разработчик рекомендует структурированные рабочие процессы.
Пользователь Reddit сообщает о счёте в $300 от Anthropic из-за использования OpenClaw с расплывчатыми запросами. Сообщество отмечает, что этот оркестратор работает лучше всего с чёткими намерениями и структурированными рабочими процессами, а не как «джинн» для исполнения желаний.