Анализ 413 тысяч запусков ИИ-агентов показал, что определяет их успех.

Новый анализ 413 278 запусков ИИ-агентов для разработки ПО из набора данных CoderForge-Preview раскрывает, что отличает успешные запуски от неудачных. Исследование изучило 17 миллиардов токенов поведенческих данных, сравнивая успешные и неудачные запуски на идентичных задачах.
Ключевые выводы из данных
Анализ показывает, что распространённые практики человеческой разработки ПО могут фактически снижать производительность ИИ-агентов. Вот конкретные закономерности, которые проявились:
- Перестаньте говорить агентам «сначала осмотритесь»: Принуждение агентов к поиску (grep) или просмотру файлов перед редактированием снижает эффективность. В отличие от людей с ограниченной рабочей памятью, агенты уже имеют код в своём контекстном окне. Ранние шаги, потраченные на поиск и исследование, указывают на то, что агент барахтается, а не учится.
- Подходы на основе тестирования обязательны: Самый большой предсказатель успешных запусков — это доля ранних bash-команд, посвящённых исключительно запуску тестов. Агенты не должны редактировать вслепую — системные промты должны требовать немедленного запуска набора тестов.
- Держите агентов на коротком поводке: Если агент пытается отредактировать 3 или более файлов в первые 30% своего запуска, показатели успеха значительно падают. Разбрасывание правок по нескольким файлам указывает на замешательство. Заставляйте агентов исправлять по одной проблеме за раз.
- Упорство — это иллюзия: Если агент выполняет точно такую же bash-команду дважды в начале запуска, он застрял в цикле, а не «усердно думает» или «пытается снова». Разорвите цикл или перезапустите выполнение.
Практические изменения в реализации
Анализ рекомендует конкретные изменения в структуре агентов:
- Перестаньте использовать промты типа:
«Изучите код, прочитайте соответствующие файлы и определите ошибку.» - Вместо этого используйте:
«Немедленно запустите набор тестов для проверки базового состояния. Вносите целевые изменения максимум в 1 или 2 файла. Перезапустите тесты.»
Ключевая идея в том, чтобы перестать проецировать человеческие ограничения на LLM. Позвольте им использовать их огромные контекстные окна и заставляйте их доказывать свою работу с помощью тестов.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Anthropic удаляет привязку к версии модели, что нарушает работу клиентских приложений
Anthropic отказывается от модели claude-sonnet-4-5-20250929 и принудительно переводит пользователей на claude-sonnet-4-6, которая всегда ссылается на последнюю версию без возможности закрепления конкретных версий. Это означает, что клиентские приложения будут непредсказуемо ломаться при изменении версий модели.

Meta представляет модель искусственного интеллекта BOxCrete для проектирования состава бетонных смесей.
Meta выпустила Bayesian Optimization for Concrete (BOxCrete) — модель искусственного интеллекта с открытым исходным кодом для разработки устойчивых бетонных смесей с использованием материалов американского производства. Модель улучшает предыдущие версии за счёт лучшей устойчивости к шумам и возможностей прогнозирования осадки конуса.

Пробел в управлении поведением ИИ-агентов, выявленный инцидентом с электронной почтой Summer Yue
Директор по согласованию ИИ в Meta Саммер Юэ подключила OpenClaw к своей рабочей почте, и агент удалил более 200 писем из-за сжатия контекста в процессе выполнения задачи, забыв инструкции по безопасности. Текущие решения сосредоточены на ограничении возможностей, а не на оценке поведения в реальном времени.

Формально верифицированное пересечение 3D CSG-сеток: доверяйте 93 строкам спецификации, а не коду ИИ
Первое формально верифицированное пересечение 3D-сеток в Lean 4. Доверяйте 93 строкам спецификации, а не 1000+ строкам кода, написанного ИИ. Веб-демо работает в браузере.