Понимание автономности AI-агентов в реальных приложениях

Исследование Anthropic сосредоточено на измерении автономии искусственных агентов, таких как Claude Code, в практических приложениях. Это исследование изучает, насколько автономными могут стать эти агенты, когда их используют в различных областях, включая разработку программного обеспечения, здравоохранение, финансы и кибербезопасность.
Ключевые выводы
- Увеличение автономии у Claude Code: В исследовании было отмечено, что продолжительность сессий Claude Code почти удвоилась до более чем 45 минут за три месяца, что указывает на возросшую способность к автономии.
- Опытные пользователи и функция авто-одобрения: Пользователи Claude Code со временем становятся более склонными использовать функцию авто-одобрения, при этом опытные пользователи реже вмешиваются, за исключением необходимости.
- Инициированные агентом уточнения: Claude Code чаще останавливается для получения уточнений, чем его прерывают пользователи, особенно во время сложных задач, демонстрируя свою способность управлять неоднозначностью самостоятельно.
- Использование в различных областях и уровни риска: Действия текущих искусственных агентов в основном имеют низкий риск и обратимы, с значительным использованием в разработке программного обеспечения (почти 50% всех действий) и новыми функциями в здравоохранении, финансах и кибербезопасности.
Методология
Исследование подошло к анализу агентов ИИ, разбивая использование инструментов через их публичный API и прямые данные от Claude Code. Они использовали метрики для отслеживания операций без восстановления целых сессий, предлагая подробный обзор взаимодействий отдельных инструментов.
Рекомендации для разработчиков
Для обеспечения эффективного контроля над развертыванием ИИ исследование подчеркивает необходимость в новых структурах мониторинга после развертывания и передовых парадигмах взаимодействия человека и ИИ. Это позволило бы упростить управление совместной автономией и смягчить риски, связанные с использованием искусственных агентов.
📖 Читать источник: HN AI Agents
👀 Смотрите также

Полностью автоматизированные обучающие видео о продукте: Claude + Playwright + Magic Hour + Remotion
Разработчик создал полностью автоматический пайплайн, который превращает URL функции в готовое обучающее видео, используя Claude для сценария и оркестровки, Playwright для записи экрана, Magic Hour API для замены лица и синхронизации губ, а также Remotion для монтажа.

Вызовы и уроки разработки системы торговли на основе машинного обучения с Клодо.
Разработка сложной торговой системы на основе машинного обучения с использованием Claude Opus 4.5 выявила проблемы интеграции с несколькими ML-движками, подчеркивая важность тщательной верификации в процессе разработки.

Клод Опус 4.6 анализирует письма Баффетта, чтобы вслепую выбирать акции.
Разработчик использовал Claude Code с сабагентами для извлечения инвестиционных принципов Уоррена Баффетта из 48 лет писем акционерам (561 849 слов), затем применил их для оценки 50 анонимизированных акций. Opus 4.6 правильно определил 60% реальных холдингов Berkshire в своих топ-10 выборах, одновременно отвергнув анти-баффеттовские контрольные акции.

Эффективность исправления ошибок в Claude Haiku 4.5 сильно зависит от качества промпта, показывают пользовательские тесты.
Тестирование с участием 380 пользователей на реальных производственных ошибках показывает, что Claude Haiku 4.5 может эффективно исправлять ошибки при наличии надлежащего контекста, но результаты значительно различаются в зависимости от того, насколько хорошо пользователи описывают проблему.