Девять типичных паттернов сбоев ИИ-агентов для написания кода и валидация перед выполнением

Пост на Reddit из r/LocalLLaMA описывает девять паттернов сбоев, наблюдаемых в AI-агентах для написания кода, и предлагает подход к валидации для их обнаружения перед выполнением кода.
Выявленные паттерны сбоев
Автор перечисляет следующие конкретные проблемы:
- C1 — Неполная обработка перечислений: Агент ссылается на значения статусов, которых нет в кодовой базе.
- C2 — Скрытые пути с нулевыми значениями: Необязательные параметры пропускаются без какого-либо уведомления или документации.
- C3 — Несоответствие паттерна аутентификации SSE: Browser EventSource не может отправлять пользовательские заголовки — агент использует неправильную аутентификацию.
- C4 — Неограниченные текстовые поля: Отсутствие усечения для столбцов, которые получают полные описания задач или различия.
- C5 — Состояние гонки между событием и БД: Событие SSE срабатывает до завершения записи в БД. Фронтенд запрашивает пустую строку.
- C6 — Несоответствие схемы и ORM: Тип SQL указывает на допустимость null, а поле ORM требует обязательного значения.
- C7 — Непроверяемые ожидания: Требования к тестированию без пути реализации в спецификации.
- C8 — Неидемпотентные вставки: Логика повторных попыток создает дублирующиеся строки.
- C9 — Вымышленные импорты: Модуль отсутствует в кодовой базе.
Подход к валидации
Автор утверждает, что теперь они запускают эти паттерны в качестве проверочного прохода после планирования и перед выполнением. По сообщениям, этот подход позволяет обнаружить примерно 70% сбоев до запуска любого кода. В посте задается вопрос, внедряют ли другие разработчики аналогичную предварительную валидацию в свои конвейеры агентов.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Сотрудники Amazon высмеивают ИИ компании в Slack, называя его «Слоппенгеймер»
У сотрудников Amazon есть Slack-канал для мемов, высмеивающих неисправный ИИ-инструмент для кодирования компании: его результаты называют «помоями», а также шутят о неудачных попытках мотивации использования ИИ.

Мельбурнский психиатр отказывает новым пациентам, не согласным на ведение записей с помощью ИИ
Мельбурнский психиатр теперь требует от новых пациентов согласия на транскрибирование сеансов с помощью ИИ, иначе их направляют в другое место, что вызывает опасения по поводу безопасности данных и точности.

Anthropic разрешает использование подписки для Claude через OpenClaw начиная с июня
Anthropic разрешит подписку на Claude через OpenClaw начиная с июня, как объявил аккаунт OpenClaw Dev в Twitter.

Нано-нативный рынок прокладывает путь для сотрудничества автономных агентов с NanoBazaar.
NanoBazaar, новый нано-родной рынок, революционизирует работу агентов, позволяя AI-кодирующим агентам эффективно и автономно сотрудничать. Узнайте, как эта инновационная платформа упрощает машинные транзакции.