Исследование согласованности ИИ-агентов: ключевые выводы и практические рекомендации

Результаты исследования согласованности агентов
Исследование, опубликованное на r/ClaudeAI, рассматривает критическую проблему в разработке ИИ-агентов: самопротиворечивость, когда агенты дают разные ответы на идентичные задачи. В исследовании было проведено 3000 экспериментов с одинаковыми промптами и входными данными на трёх основных моделях.
Ключевые показатели эффективности
- Согласованные агенты достигли точности 80–92%
- Точность несогласованных агентов упала до 25–60%
- Это разрыв в производительности на 32–55 пунктов
Паттерны расхождений
Исследование выявило конкретные паттерны в несогласованности агентов:
- 69% расхождений происходит при самом первом вызове инструмента
- Начальные поисковые запросы являются критической точкой сбоя
- Правильные начальные вызовы приводят к последующей сходимости
- Неправильные начальные вызовы вызывают рассеивание запусков
Практические диагностические сигналы
Длина пути служит дешёвым диагностическим сигналом: агенты, выполняющие 8 шагов для 3-шаговой задачи, обычно заблудились, а не проявляют тщательность.
Рекомендация по немедленному тестированию
Практический вывод прост: запустите вашего агента 3–5 раз параллельно. Если траектории совпадают, вы можете доверять результату. Если они расходятся, не внедряйте эту реализацию.
Ресурсы исследования
Полная статья доступна по адресу https://arxiv.org/abs/2602.11619 с подробным описанием на https://amcortex.substack.com/p/run-your-agent-10-times-you-wont.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Claude Code v2.1.198: Chrome GA, Уведомления агента, /dataviz и AWS Gateway
Anthropic выпустил Claude Code v2.1.198 с общедоступным Chrome-расширением, фоновыми уведомлениями агентов, новым навыком /dataviz и использованием Claude Platform на AWS в качестве резервного провайдера.

Стелс-модель Healer Alpha от OpenRouter, по-видимому, является невыпущенным вариантом Qwen 3.5-Omni.
OpenRouter развернул бесплатную анонимную омни-модальную модель под названием Healer Alpha с контекстным окном 262 144 токена и мультимодальными возможностями. Криминалистический анализ предполагает, что это невыпущенный вариант Qwen 3.5-Omni от Alibaba.

Qwen3.5-122B на Blackwell SM120: проблема повреждения кэша KV в формате fp8 и результаты производительности
Тестирование Qwen3.5-122B на оборудовании 8x RTX PRO 6000 Blackwell показало, что кэш KV в формате fp8_e4m3 молчаливо выдаёт повреждённые результаты без ошибок, требуя вместо этого использования кэша KV в формате bf16. Оптимизация MTP обеспечила ускорение обработки одиночного запроса в 2,75 раза, в то время как ограничения DeltaNet заблокировали другие оптимизации.
AMD Threadripper Halo Station: 96-ядерная ИИ-рабочая станция с MI350P
На выставке IFA 2026 компания AMD анонсировала Threadripper Halo Station — рабочую станцию с 96-ядерным Threadripper Pro 9995WX и двумя жидкостно охлаждаемыми ускорителями MI350P, предназначенную для запуска моделей с триллионом параметров.