Nove Padrões Comuns de Falha em Agentes de Codificação de IA e Validação Pré-Execução

Uma postagem no Reddit do r/LocalLLaMA detalha nove padrões de falha observados em agentes de codificação de IA e propõe uma abordagem de validação para capturá-los antes da execução do código.
Padrões de Falha Identificados
O autor lista esses problemas específicos:
- C1 — Tratamento incompleto de enumerações: O agente faz referência a valores de status que não existem na base de código.
- C2 — Caminhos nulos silenciosos: Parâmetros opcionais são ignorados silenciosamente sem documentação.
- C3 — Incompatibilidade do padrão de autenticação SSE: O EventSource do navegador não pode enviar cabeçalhos personalizados — o agente usa a autenticação errada.
- C4 — Campos de texto ilimitados: Nenhum truncamento em colunas que recebem descrições completas de tarefas ou diffs.
- C5 — Condição de corrida entre evento/banco de dados: O evento SSE é disparado antes que a gravação no banco de dados seja concluída. O front-end consulta uma linha vazia.
- C6 — Incompatibilidade entre esquema/ORM: O tipo SQL diz que é anulável, o campo ORM diz que é obrigatório.
- C7 — Expectativas não testáveis: Requisitos de teste sem caminho de implementação na especificação.
- C8 — Inserções não idempotentes: A lógica de repetição cria linhas duplicadas.
- C9 — Importações alucinadas: O módulo não existe na base de código.
Abordagem de Validação
O autor afirma que agora executa esses padrões como uma etapa de validação após o planejamento e antes da execução. Essa abordagem supostamente captura aproximadamente 70% das falhas antes que qualquer código seja executado. A postagem conclui perguntando se outros estão construindo validações pré-execução semelhantes em seus pipelines de agentes.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Título: Terry Tao sobre Verificadores de Provas por IA: Lean, Colaboração e Matemática Formal
Terry Tao prevê que matemáticos vão colaborar em centenas e ter suas provas verificadas por computadores como Lean, não por humanos. Um trecho da Quanta Magazine explora essa visão.

Claude Cowork Agora Disponível no Windows com Acesso a Arquivos Locais e Agendamento de Tarefas
O Claude Cowork, anteriormente exclusivo para macOS, agora está acessível em dispositivos Windows. O aplicativo de desktop requer um plano pago do Claude, lida com tarefas maiores com acesso direto a arquivos locais e permite agendar tarefas para serem executadas automaticamente.

Título do artigo: Visão Geral da IA do Google Rotula Falsamente Violinista Canadense como Criminoso Sexual, Processo Protocolado
Ashley MacIsaac processa Google por US$ 1,5 milhão após o AI Overview gerar afirmações falsas de que ele era um criminoso sexual condenado, levando ao cancelamento de um show.

Desenvolvedor Substitui Assistente Virtual de US$ 25/h por Agentes de IA e Enfrenta Implicações Éticas
Um desenvolvedor substituiu um assistente virtual de US$ 25/hora por agentes de IA que lidam com acompanhamentos, agendamentos, rastreamento de leads e atualizações de CRM. A configuração de IA custa cerca de US$ 1.000/mês e executa as tarefas mais rápido e com mais consistência do que o assistente humano.