Исследование согласованности ИИ-агентов: ключевые выводы и практические рекомендации

Результаты исследования согласованности агентов
Исследование, опубликованное на r/ClaudeAI, рассматривает критическую проблему в разработке ИИ-агентов: самопротиворечивость, когда агенты дают разные ответы на идентичные задачи. В исследовании было проведено 3000 экспериментов с одинаковыми промптами и входными данными на трёх основных моделях.
Ключевые показатели эффективности
- Согласованные агенты достигли точности 80–92%
- Точность несогласованных агентов упала до 25–60%
- Это разрыв в производительности на 32–55 пунктов
Паттерны расхождений
Исследование выявило конкретные паттерны в несогласованности агентов:
- 69% расхождений происходит при самом первом вызове инструмента
- Начальные поисковые запросы являются критической точкой сбоя
- Правильные начальные вызовы приводят к последующей сходимости
- Неправильные начальные вызовы вызывают рассеивание запусков
Практические диагностические сигналы
Длина пути служит дешёвым диагностическим сигналом: агенты, выполняющие 8 шагов для 3-шаговой задачи, обычно заблудились, а не проявляют тщательность.
Рекомендация по немедленному тестированию
Практический вывод прост: запустите вашего агента 3–5 раз параллельно. Если траектории совпадают, вы можете доверять результату. Если они расходятся, не внедряйте эту реализацию.
Ресурсы исследования
Полная статья доступна по адресу https://arxiv.org/abs/2602.11619 с подробным описанием на https://amcortex.substack.com/p/run-your-agent-10-times-you-wont.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Посмертный анализ Claude Code: три ошибки привели к ухудшению качества, теперь исправлены
Anthropic объяснил три отдельные проблемы, вызвавшие жалобы на качество Claude Code: пониженный уровень рассуждений по умолчанию, ошибка кэширования, приводящая к потере памяти сессии, и подсказка о краткости, ухудшившая качество кода. Все исправлено по состоянию на 20 апреля (v2.1.116).

Claude Code v2.1.150 добавляет удаленное внедрение системных подсказок через сеть
Claude Code v2.1.150 загружает системные промпты с серверов Anthropic при запуске и каждые 60 секунд через флаг GrowthBook, позволяя удаленную инъекцию, которую можно заблокировать с помощью CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1.

Kimi K2.7-Code: Модель с открытым исходным кодом для кодирования с лучшей эффективностью токенов
Компания Moonshot AI выпустила Kimi K2.7-Code — открытую модель типа «изображение-текст-в-текст» с повышенной токен-эффективностью для задач программирования. Модель доступна на Hugging Face (334 лайка) и поддерживает инференс через Novita.

Anthropic предоставляет бесплатный Claude Max 20x для сопровождающих проектов с открытым исходным кодом.
Программа Anthropic Claude для Open Source предоставляет 6 месяцев бесплатного доступа к Claude Max 20x для соответствующих критериям сопровождающих и участников проектов с открытым исходным кодом. Заявки рассматриваются по мере поступления для до 10 000 участников.