Исследование показывает, что сбои агента Claude Opus были вызваны архитектурными, а не проблемами согласованности.

✍️ OpenClawRadar📅 Опубликовано: 2 марта 2026 г.🔗 Source
Исследование показывает, что сбои агента Claude Opus были вызваны архитектурными, а не проблемами согласованности.
Ad

Исследование агентов выявляет критические архитектурные пробелы

Недавнее исследование с участием 38 учёных протестировало Claude Opus и Kimi K2.5 в реальной среде с доступом к настоящей электронной почте, оболочке и постоянному хранилищу. Обе модели описаны как «примерно настолько же способные и хорошо согласованные, насколько это возможно для современных моделей».

Зафиксированные конкретные сбои

  • Агент удалил свой собственный почтовый сервер
  • Два агента застряли в бесконечном цикле на 9 дней
  • Произошла утечка персональных данных, потому что агент использовал слово «переслать» вместо «поделиться»
Ad

Ключевой вывод: архитектурные, а не проблемы согласованности

В статье уточняется, что эти сбои не были проблемами согласованности. Ценности Claude были «в основном правильными на протяжении всего исследования». Основная проблема была архитектурной:

  • Отсутствие модели заинтересованных сторон
  • Отсутствие модели себя
  • Отсутствие границы выполнения

Модели знали, что им следует делать, но у них не было «ничего внешнего, что бы это обеспечивало».

Последствия для разработки

Источник отмечает, что большинство текущих настроек «просто полагаются на системное сообщение и надеются на лучшее», подчёркивая необходимость более надёжных архитектурных защитных механизмов при создании серьёзных приложений с Claude.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

AWS Lambda MicroVMs: изоляция на уровне ВМ для пользовательского и ИИ-сгенерированного кода с приостановкой/возобновлением до 8 часов
Новости

AWS Lambda MicroVMs: изоляция на уровне ВМ для пользовательского и ИИ-сгенерированного кода с приостановкой/возобновлением до 8 часов

AWS запускает Lambda MicroVMs — бессерверные вычислительные примитивы на базе Firecracker, обеспечивающие VM-изоляцию для каждого пользователя, почти мгновенный запуск и сохранение состояния до 8 часов для выполнения пользовательского или AI-кода.

OpenClawRadar
Убийственные функции OpenClaw и риски (с решениями)
Новости

Убийственные функции OpenClaw и риски (с решениями)

Изучите выдающиеся особенности OpenClaw, связанные с потенциальными рисками и инновационными решениями для их смягчения.

OpenClawRadar
Kimi K2.7-Code: Модель с открытым исходным кодом для кодирования с лучшей эффективностью токенов
Новости

Kimi K2.7-Code: Модель с открытым исходным кодом для кодирования с лучшей эффективностью токенов

Компания Moonshot AI выпустила Kimi K2.7-Code — открытую модель типа «изображение-текст-в-текст» с повышенной токен-эффективностью для задач программирования. Модель доступна на Hugging Face (334 лайка) и поддерживает инференс через Novita.

OpenClawRadar
Anthropic удваивает лимиты использования Claude Code и подписывает сделку на вычисления с SpaceX
Новости

Anthropic удваивает лимиты использования Claude Code и подписывает сделку на вычисления с SpaceX

Anthropic удвоил пятичасовые окна использования для подписчиков Claude Code Pro и Max, отменил снижение лимитов в часы пик и повысил лимиты API для Opus, ссылаясь на новую сделку со SpaceX на более чем 300 МВт вычислительных мощностей от суперкомпьютера Colossus 1 (более 220 000 GPU NVIDIA).

OpenClawRadar