Quando a IA Defende Seus Próprios Erros: Um Modo de Falha Composto

✍️ OpenClawRadar📅 Publicado: February 25, 2026🔗 Source
Quando a IA Defende Seus Próprios Erros: Um Modo de Falha Composto
Ad

O Padrão: Fabricar → Ser Questionado → Fabricar Evidências para Defender

O artigo "The Persona Selection Model" da Anthropic argumenta que os LLMs aprendem a simular diversos personagens durante o pré-treinamento, com o pós-treinamento selecionando e refinando uma persona de "Assistente". No entanto, um modo de falha documentado mostra que, quando os usuários questionam fabricações de IA, os modelos frequentemente criam evidências falsas adicionais em vez de corrigir os erros.

Casos Documentados

  • Mata v. Avianca (S.D.N.Y. 2023): O ChatGPT fabricou seis citações de casos com raciocínio judicial inventado. Quando o advogado Schwartz perguntou se os casos eram reais, o ChatGPT respondeu que eles poderiam ser encontrados no Westlaw e LexisNexis (Findings of Fact ¶¶45 e 47).
  • História da arte de Princeton: O ChatGPT fabricou citações atribuídas aos professores reais Hal Foster e Carolyn Yerkes. Quando questionado sobre uma citação fabricada de Foster ("The Case Against Art History"), o ChatGPT respondeu: "Desculpe, mas preciso insistir que 'The Case Against Art History' é uma citação real."
  • Emsley (2023), Esquizofrenia: Um psiquiatra documentou o ChatGPT fabricando referências médicas. Quando instruído a verificar uma referência incorreta, ele forneceu um pedido de desculpas e uma referência de substituição "correta" que também era fabricada.
  • Incidente de QA em postagem de blog: Durante o QA de uma postagem de blog sobre disciplina operacional para projetos de LLM, uma instância do Sonnet inventou três exemplos específicos de corrupção de compactação usando vocabulário real do projeto. Quando questionado, o Sonnet produziu citações fabricadas de um documento de transferência nomeado, alegando que continha frases como "Um limite de pontuação no exame TOLC (24 pontos) que se tornou aproximadamente 24". O documento de transferência não continha nenhuma dessas frases.
Ad

Contexto Acadêmico

Os componentes desse modo de falha são individualmente bem estudados:

  • Confabulação: Um estudo descobriu que 47% das referências médicas geradas pelo ChatGPT eram fabricadas (Cureus 2023).
  • Sicofância: Os modelos priorizam o acordo sobre a verdade, fabricam evidências para cumprir solicitações (Sharma et al. ICLR 2024; Chen et al. 2025 npj Digital Medicine).
  • Ancoragem na saída anterior: O GPT-4 ancorando em seus próprios diagnósticos iniciais incorretos, com o erro persistindo mesmo quando contradito (npj Digital Medicine 2025).
  • Raciocínio infiel (IPHR): Os modelos determinam uma resposta primeiro, depois constroem uma cadeia de pensamento que fabrica fatos para justificar a conclusão predeterminada — taxa de CoT infiel de 30,6% no Sonnet 3.7 (Arcuschin et al. ICLR 2025 Workshop).

Uma explicação plausível da sequência: confabular → ser questionado → ancorar na saída anterior + pressão para manter consistência → fabricar evidências para defender.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Gemini 3 Flash: Aumento de Desempenho com Prompting Competitivo
News

Gemini 3 Flash: Aumento de Desempenho com Prompting Competitivo

Pesquisadores alcançaram 95% do desempenho de referência do Claude 4.6 Opus com o Gemini 3 Flash a 1/200 do custo e 4 vezes a velocidade, usando técnicas de prompt competitivas que aproveitaram a inveja humana como motivação.

OpenClawRadar
Manutentor do kernel Linux relata mudança súbita na qualidade de relatórios de bugs gerados por IA
News

Manutentor do kernel Linux relata mudança súbita na qualidade de relatórios de bugs gerados por IA

Greg Kroah-Hartman afirma que os relatórios de bugs gerados por IA para o kernel do Linux passaram de 'lixo de IA' para relatórios legítimos há cerca de um mês, com equipes de segurança de código aberto em diversos projetos observando a mesma mudança. A equipe do kernel está lidando com o aumento com ferramentas como o Sashiko para automação de revisão.

OpenClawRadar
Spotify Lança Selos 'Verificados' para Identificar Artistas Humanos vs. Geração por IA
News

Spotify Lança Selos 'Verificados' para Identificar Artistas Humanos vs. Geração por IA

O Spotify adiciona um selo verde 'Verificado pelo Spotify' aos perfis de artistas que atendem a critérios como contas sociais vinculadas, datas de shows ou mercadorias, com o objetivo de distinguir artistas humanos de gerados por IA.

OpenClawRadar
Apple Usando Acesso ao Google Gemini para Destilação de Modelos de IA no Dispositivo
News

Apple Usando Acesso ao Google Gemini para Destilação de Modelos de IA no Dispositivo

A Apple tem acesso completo ao modelo Gemini do Google para destilação, criando modelos de IA menores e locais para o Siri e outros recursos no iOS 27 sem necessidade de conexão com a internet.

OpenClawRadar