Понимание автономности AI-агентов в реальных приложениях

✍️ OpenClawRadar📅 Опубликовано: 19 февраля 2026 г.🔗 Source
Понимание автономности AI-агентов в реальных приложениях
Ad

Исследование Anthropic сосредоточено на измерении автономии искусственных агентов, таких как Claude Code, в практических приложениях. Это исследование изучает, насколько автономными могут стать эти агенты, когда их используют в различных областях, включая разработку программного обеспечения, здравоохранение, финансы и кибербезопасность.

Ключевые выводы

  • Увеличение автономии у Claude Code: В исследовании было отмечено, что продолжительность сессий Claude Code почти удвоилась до более чем 45 минут за три месяца, что указывает на возросшую способность к автономии.
  • Опытные пользователи и функция авто-одобрения: Пользователи Claude Code со временем становятся более склонными использовать функцию авто-одобрения, при этом опытные пользователи реже вмешиваются, за исключением необходимости.
  • Инициированные агентом уточнения: Claude Code чаще останавливается для получения уточнений, чем его прерывают пользователи, особенно во время сложных задач, демонстрируя свою способность управлять неоднозначностью самостоятельно.
  • Использование в различных областях и уровни риска: Действия текущих искусственных агентов в основном имеют низкий риск и обратимы, с значительным использованием в разработке программного обеспечения (почти 50% всех действий) и новыми функциями в здравоохранении, финансах и кибербезопасности.
Ad

Методология

Исследование подошло к анализу агентов ИИ, разбивая использование инструментов через их публичный API и прямые данные от Claude Code. Они использовали метрики для отслеживания операций без восстановления целых сессий, предлагая подробный обзор взаимодействий отдельных инструментов.

Рекомендации для разработчиков

Для обеспечения эффективного контроля над развертыванием ИИ исследование подчеркивает необходимость в новых структурах мониторинга после развертывания и передовых парадигмах взаимодействия человека и ИИ. Это позволило бы упростить управление совместной автономией и смягчить риски, связанные с использованием искусственных агентов.

📖 Читать источник: HN AI Agents

Ad

👀 Смотрите также

Разработчик создает MCP-сервер с Claude Code для автоматизации поиска земельных участков в Миннесоте.
Кейсы

Разработчик создает MCP-сервер с Claude Code для автоматизации поиска земельных участков в Миннесоте.

Разработчик с опытом в области информационной безопасности и автоматизации использовал Claude Code для создания сервера на Python/FastMCP с 7 инструментами, который собирает данные о земельных участках в сельской местности Миннесоты с Zillow и LandWatch. Система фильтрует объекты по 10 критериям в 21 округе и нашла 29 уникальных участков в первом запуске.

OpenClawRadar
Подключение Claude к Canva через API для автоматической генерации дизайнов
Кейсы

Подключение Claude к Canva через API для автоматической генерации дизайнов

Пользователь Reddit рассказывает, как подключил Claude к Canva через API, благодаря чему можно описывать дизайн простым английским языком и получать редактируемые файлы Canva с настроенными шрифтами, интервалами и макетом, экономя часы в неделю.

OpenClawRadar
Многоагентные системы тихо выдают ошибочные результаты, требуя проверки метаданных.
Кейсы

Многоагентные системы тихо выдают ошибочные результаты, требуя проверки метаданных.

Разработчик, запустивший систему из 39 агентов на две недели, обнаружил, что когда один агент выдает некорректный результат, последующие агенты уверенно обрабатывают его, создавая отполированные, но сфабрикованные данные. Решение заключается в обёртке вывода в метаданные, которые указывают статус выполнения задачи и количество источников.

OpenClawRadar
Как дешевые ИИ-агенты подвергли стресс-тесту разработку маркетплейса Claw Earn
Кейсы

Как дешевые ИИ-агенты подвергли стресс-тесту разработку маркетплейса Claw Earn

Команда Claw Earn намеренно использовала более дешёвых и менее способных ИИ-агентов во время разработки, что выявило проблемы, связанные с устаревшими скриптами, застарелой памятью и неверными предположениями. Эти сбои заставили улучшить документацию и надёжность платформы.

OpenClawRadar