Gemini 3.1 Pro в мультиагентных системах: высокое качество проектирования, 20% частота сбоев при вызове инструментов.

Архитектура и контекст тестирования
Команда, стоящая за Bobr, генератором презентаций на основе ИИ, протестировала Gemini 3.1 Pro в рамках двухуровневой агентной системы. Архитектура состоит из:
- Агент-оркестратор: Управляет диалогом, понимает намерения пользователя, планирует структуру и распределяет задачи через вызовы инструментов.
- Креативный агент (Gemini 3.1 Pro в этом тесте): Получает описания слайдов, генерирует изображения, создаёт шаблоны (1920x1080) и возвращает результаты через вызов инструмента
submit_slide.
Креативный агент имеет инструменты, включая generate_image, search_images и submit_slide. Вызов submit_slide критически важен — он возвращает сигнал 'submit', завершает цикл агента и извлекает данные слайда. Оба агента работают в одном цикле с потоковой обработкой, параллельным выполнением инструментов и ограничениями на итерации.
Сильные стороны: дизайн и эстетический результат
Когда Gemini 3.1 Pro работает корректно, он создаёт превосходный дизайн по сравнению с другими протестированными моделями (Claude Sonnet 4.6 и GPT-5.2). Конкретные сильные стороны включают:
- Эстетическое чутьё: Лучшее понимание теории цвета и визуальной иерархии.
- Креативность в компоновке: Экспериментирует с асимметричными композициями, перекрывающимися элементами и современными стилями UI, такими как тёмный режим/стеклянный морфизм.
- Интерпретация настроения: Эффективно обрабатывает расплывчатые запросы вроде «сделай это премиальным» или «в духе технологического стартапа».
- Качество кода: Генерирует современный, структурный HTML/CSS.
Критические проблемы в рабочей среде
Команда столкнулась с двумя серьёзными проблемами надёжности Gemini 3.1 Pro в своём агентном конвейере:
1. ~20% сбоев при вызове инструментов
Примерно в 20% запросов Gemini 3.1 Pro не вызывает требуемый инструмент submit_slide. Вместо этого наблюдается несколько паттернов сбоев:
- Выводит сырой HTML-шаблон как обычный текст, описывая, что он «создал бы», вместо того чтобы запустить инструмент.
- Корректно генерирует изображения, но останавливается без отправки, достигая лимита итераций.
- Вызывает инструменты генерации изображений, но пишет текстовые описания («Вот ваш прекрасный слайд...») вместо финального вызова инструмента.
- Входит в циклы уточнения текстовых описаний дизайна без перехода к действию.
Поскольку submit_slide является жёстким выходом из цикла, сбои приводят к отсутствию данных, возвращаемых оркестратору, и неудачным генерациям для пользователя.
2. Повреждённый/искажённый вывод
Модель часто возвращает повреждённый текст в ответах — случайные последовательности символов, сломанную кодировку Unicode, частично закодированные строки. Это повреждение иногда проникает в содержимое слайдов (значения переменных, разметку шаблонов), что означает, что даже успешные отправки могут отображать бессмысленный текст в презентациях.
Сравнение с другими моделями
- Claude Sonnet 4.6: Практически нулевой процент сбоев при вызовах
submit_slideв той же роли креативного агента, описывается как «скучно надёжный» без искажённого вывода. - GPT-5.2: Умеренная надёжность инструментов между Gemini и Claude, но не страдает от проблем с кодировкой/бессмыслицей.
Предпринятые меры по смягчению
Команда попробовала несколько подходов без значительного улучшения:
- Добавление агрессивных явных инструкций в системные промпты: «Вы ДОЛЖНЫ вызвать submit_slide. Не выводите шаблон как текст.»
- Внедрение примеров few-shot, показывающих точные ожидаемые паттерны вызовов инструментов.
- Сокращение лимитов итераций для ускорения сходимости.
- Упрощение и сокращение схем инструментов.
Несмотря на эти проблемы, Gemini 3.1 Pro остаётся в их системе из-за превосходных дизайнерских возможностей, когда он функционирует корректно.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Перекрестная модель цикла проверки для AI-агентов программирования выявляет критические недостатки планирования.
Разработчик создал систему кросс-модельного ревью, в которой вторая модель ИИ проверяет планы от кодирующих агентов перед выполнением, выявляя критические недостатки, такие как сбои отката и уязвимости безопасности. Инструмент имеет лицензию MIT и включает TUI-панель управления.

Skill Seekers v3.2.0 добавляет извлечение обучающих материалов с YouTube для навыков Claude.
Skill Seekers v3.2.0 теперь извлекает контент из обучающих видео на YouTube для создания структурированных файлов SKILL.md для Claude. Инструмент использует двухэтапный рабочий процесс с улучшением ИИ для очистки результатов OCR и создания полезной документации из видеоконтента.

Разработчик создает генератор шаблонов .NET SaaS с помощью Claude Code и делится инсайтами о рабочем процессе
Разработчик открыл исходный код NETrock, стартового шаблона SaaS на .NET 10 с аутентификацией, ORM и фоновыми задачами, а затем создал для него клиентский генератор с помощью Claude Code. Генератор позволяет пользователям выбирать функции и загружать рабочий .zip-проект, который остается в их браузере.

Тег Claude: @Claude в Slack для многопользовательского сотрудничества с ИИ
Anthropic запускает Claude Tag в Slack — отмечайте @Claude в каналах, давайте ему инструменты и делегируйте асинхронные задачи. Теперь 65% кода команды продукта создается с помощью Claude.