Dois Erros de IA em Uma Demo: Claude Code Corrige Ortografia em Vez de Erro de Esquema, OpenAI Bagunça Mapeamento de Campo Personalizado

Durante um workshop na Prismatic, um engenheiro construiu uma integração B2B completa ao vivo. Duas ferramentas de IA falharam de maneiras distintas, ilustrando que o comportamento de agentes no mundo real é caótico e não determinístico.
Claude Code: Resolveu o Problema Errado
O Claude Code criou um assistente de configuração usando JSON Forms em cerca de 30 segundos. O assistente gerado parecia bom, mas um erro de validação de esquema JSON surgiu durante os testes — algo sobre "não deve ter menos de um item". Quando o engenheiro pediu ao Claude para corrigir, o agente passou os minutos seguintes corrigindo avisos de ortografia no arquivo em vez de lidar com o erro de esquema. O engenheiro eventualmente disse "espero que esteja fazendo mais do que corrigir problemas de ortografia" e desistiu, colando o código de uma execução de teste feita na noite anterior.
OpenAI: Lixo na Primeira Tentativa com Campos Estranhos
A integração chama a OpenAI em tempo de execução para gerar mapeamentos de campo padrão entre o esquema Salesforce de um cliente e o aplicativo de destino. Para um contato normal do Salesforce (email-para-email, empresa-para-empresa), funcionou bem — "chato" segundo o autor. Mas em um tipo de registro personalizado com nomes de campo deliberadamente estranhos — Group name, Internet address, Physical place, Internet email address — a primeira chamada retornou lixo. Uma segunda tentativa acertou tudo.
Principais Conclusões
- Esquemas chato subestimam LLMs — fazem o uso de agentes parecer exagero. Os casos personalizados e estranhos são onde ele mostra seu valor, mas a maioria das demonstrações os evita por simplicidade.
- Falhas ao vivo são mais úteis que sucessos. Quem já trabalhou com agentes sabe que eles são caóticos. O comportamento de "corrigiu ortografia em vez de erro de esquema" é algo que nenhuma documentação preveria.
- Diferentes formatos de falha: O Claude Code tinha tudo o que precisava, mas trabalhou no problema errado. A OpenAI "sabia" a resposta, mas não a apresentou na primeira vez. O formato da falha pode indicar como implantar cada ferramenta.
O autor trabalha na Prismatic, mas não compartilhou um link, focando na oportunidade de aprendizado em vez de autopromoção.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Google doa Protocolo de Pagamento de Agentes (AP2) para a FIDO Alliance, lança v0.2 com pagamentos 'Humano Não Presente'
O Google está doando o Agent Payments Protocol (AP2) para a FIDO Alliance e lançando a v0.2 com suporte para pagamentos autônomos 'Human Not Present' e um novo padrão de Intenção Verificável, desenvolvido em conjunto com a Mastercard.

IA Deve Elevar Seu Pensamento, Não Substituí-Lo — Koshy John sobre a Divisão Oculta na Engenharia
Koshy John argumenta que engenheiros que terceirizam o pensamento para a IA em busca de ganhos de produtividade de curto prazo estão construindo uma base oca, enquanto aqueles que usam a IA para eliminar tarefas tediosas e operar em um nível mais alto criam valor real de longo prazo.

Clanker T1000 de Greg Kroah-Hartman: LLM local no Framework Desktop com AMD Ryzen AI Max investigando bugs do kernel Linux
O 'gregkh_clanker_t1000' de Greg KH usa um LLM local rodando em um Framework Desktop (AMD Ryzen AI Max+) para fazer fuzzing no kernel Linux, resultando em ~20 patches mesclados desde 7 de abril corrigindo bugs em ALSA, HID, SMB, Nouveau, IO_uring e mais.

Agentes Gerenciados Claude Adiciona Sonhos, Resultados, Orquestração Multiagente e Webhooks
Sonhar é um processo programado de curadoria de memória que melhorou as taxas de conclusão de tarefas em aproximadamente 6x nos testes da Harvey. Resultados, orquestração multiagente e webhooks agora estão em beta público na Plataforma Claude.