Два сбоя ИИ в одной демонстрации: Claude Code исправляет орфографию вместо ошибки схемы, OpenAI путает сопоставление пользовательских полей

Во время семинара в Prismatic инженер в прямом эфире собрал B2B-интеграцию от начала до конца. Два ИИ-инструмента потерпели неудачу по-разному, иллюстрируя, что поведение реальных агентов хаотично и недетерминировано.
Claude Code: Решил не ту проблему
Claude Code за примерно 30 секунд создал каркас мастера настройки с использованием JSON Forms. Сгенерированный мастер выглядел нормально, но во время тестирования всплыла ошибка валидации JSON-схемы — что-то вроде "не должно содержать менее одного элемента". Когда инженер попросил Claude исправить это, агент следующие несколько минут вместо исправления ошибки схемы исправлял предупреждения об орфографии в файле. В конце концов инженер сказал: "надеюсь, это не ограничивается исправлением опечаток" и сдался, вставив код из черновика, сделанного накануне.
OpenAI: Мусор при первой попытке со странными полями
Интеграция вызывает OpenAI во время выполнения, чтобы сгенерировать сопоставления полей по умолчанию между схемой Salesforce клиента и целевым приложением. Для обычного контакта Salesforce (email-to-email, company-to-company) всё работало отлично — "скучно", по словам автора. Но для пользовательского типа записи с намеренно странными именами полей — Group name, Internet address, Physical place, Internet email address — первый вызов вернул мусор. Вторая попытка дала правильный результат.
Ключевые выводы
- Скучные схемы недооценивают LLM — при их использовании агенты кажутся излишними. Странные, пользовательские случаи — вот где они проявляют себя, но большинство демонстраций избегают их для простоты.
- Неудачи вживую полезнее успехов. Любой, кто работал с агентами, знает, что это хаос. Поведение "исправил орфографию вместо ошибки схемы" не предскажешь ни в какой документации.
- Разные формы неудач: У Claude Code было всё необходимое, но он работал не над той проблемой. OpenAI "знал" ответ, но не выдал его с первого раза. Форма неудачи может подсказать, как развернуть каждый инструмент.
Автор работает в Prismatic, но не поделился ссылкой, сосредоточившись на возможности обучения, а не на саморекламе.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Когнитивный долг: когда результаты ИИ опережают понимание
Пост на Reddit обсуждает «когнитивный долг» — разрыв между результатом, сгенерированным ИИ, и пониманием этого результата командой — и утверждает, что творческий контроль означает понимание того, что вы отправили. Сам пост был написан с помощью Claude, иронично комментируя эту ситуацию.

Определение ИИ-агентов: Тест на работоспособность
Обсуждение на Reddit ставит под сомнение, являются ли многие продукты с ИИ-агентами по сути чат-ботами со списком задач, предлагая тест, основанный на их способности выполнять рабочие процессы в нескольких инструментах без ручного вмешательства.

Apple Core AI Framework: Обзор основы формирующегося AI-агента Apple
На странице документации нового фреймворка Core AI от Apple появилась информация, хотя контент скрыт за JavaScript. Разбираем, что это значит для разработки AI-агентов на платформах Apple.

Claude AI тратит 81 минуту на «настоящее мышление» – скачки пользовательских отчетов вокруг крупных обновлений
Пользователь сообщает, что Claude AI потратил 1 час 21 минуту на простую задачу, предполагая, что всплески производительности происходят вскоре после крупных обновлений. Пример: исследовательский запрос просканировал 5 113 источников за один сеанс, но позже — только 100–200 источников для аналогичных запросов.