Анализ 413 тысяч запусков ИИ-агентов показал, что определяет их успех.

Новый анализ 413 278 запусков ИИ-агентов для разработки ПО из набора данных CoderForge-Preview раскрывает, что отличает успешные запуски от неудачных. Исследование изучило 17 миллиардов токенов поведенческих данных, сравнивая успешные и неудачные запуски на идентичных задачах.
Ключевые выводы из данных
Анализ показывает, что распространённые практики человеческой разработки ПО могут фактически снижать производительность ИИ-агентов. Вот конкретные закономерности, которые проявились:
- Перестаньте говорить агентам «сначала осмотритесь»: Принуждение агентов к поиску (grep) или просмотру файлов перед редактированием снижает эффективность. В отличие от людей с ограниченной рабочей памятью, агенты уже имеют код в своём контекстном окне. Ранние шаги, потраченные на поиск и исследование, указывают на то, что агент барахтается, а не учится.
- Подходы на основе тестирования обязательны: Самый большой предсказатель успешных запусков — это доля ранних bash-команд, посвящённых исключительно запуску тестов. Агенты не должны редактировать вслепую — системные промты должны требовать немедленного запуска набора тестов.
- Держите агентов на коротком поводке: Если агент пытается отредактировать 3 или более файлов в первые 30% своего запуска, показатели успеха значительно падают. Разбрасывание правок по нескольким файлам указывает на замешательство. Заставляйте агентов исправлять по одной проблеме за раз.
- Упорство — это иллюзия: Если агент выполняет точно такую же bash-команду дважды в начале запуска, он застрял в цикле, а не «усердно думает» или «пытается снова». Разорвите цикл или перезапустите выполнение.
Практические изменения в реализации
Анализ рекомендует конкретные изменения в структуре агентов:
- Перестаньте использовать промты типа:
«Изучите код, прочитайте соответствующие файлы и определите ошибку.» - Вместо этого используйте:
«Немедленно запустите набор тестов для проверки базового состояния. Вносите целевые изменения максимум в 1 или 2 файла. Перезапустите тесты.»
Ключевая идея в том, чтобы перестать проецировать человеческие ограничения на LLM. Позвольте им использовать их огромные контекстные окна и заставляйте их доказывать свою работу с помощью тестов.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Выпуск Claude Code версии 2.1.90: новые интерактивные уроки, улучшения производительности и исправления ошибок
Claude Code v2.1.90 представляет интерактивные уроки /powerup, добавляет переменную окружения CLAUDE_CODE_PLUGIN_KEEP_MARKETPLACE_ON_FAILURE для работы в офлайн-режиме, а также включает множество улучшений производительности и исправлений ошибок для инструментов, интерфейса и безопасности.

Lovable предлагает $100 бесплатных кредитов на API Claude в честь Международного женского дня.
Lovable раздает $100 кредитов на API Anthropic Claude, $250 кредитов на комиссии Stripe и 24-часовой бесплатный доступ к своей платформе до 8 марта. Пользователям необходимо активировать предложение до 12:59 по восточному времени 9 марта.

Пользователь Reddit сообщает о 18,8 ток/с при CPU-инференсе модели Qwen 3 30B Q4 на архитектуре Zen 4.
Пользователь на r/LocalLLaMA протестировал Qwen 3 30B Q4 на процессоре и достиг 18,8 токенов в секунду с процессором Zen 4 и памятью DDR5, что значительно превысило ожидания в 3-5 ток/с.

Claude Code v2.1.145: Список агентов JSON, исправления OTEL-спанов, исправление безопасности и другое
Claude Code v2.1.145 добавляет `claude agents --json` для скриптования, исправляет обход запроса разрешений, улучшает OTEL-спаны и многое другое.