A pesquisa de rastreamento de circuitos da Anthropic revela os mecanismos internos do Claude 3.5 Haiku

A Anthropic publicou uma pesquisa de rastreamento de circuitos que examina o que acontece dentro do Claude quando ele processa informações. O estudo foi conduzido em uma versão simplificada do Claude 3.5 Haiku e revela mecanismos internos específicos por meio de análise real de circuitos.
Principais descobertas da pesquisa
- Processamento de linguagem: O Claude não "pensa em francês" quando perguntado em francês. Ele atinge primeiro uma camada de conceito compartilhado e depois traduz. Isso se aplica a qualquer idioma - mesma ideia, idioma de saída diferente.
- Composição poética: Ao escrever um poema com rima, o Claude escolhe a última palavra primeiro e depois escreve a linha de trás para frente para chegar nela. Isso mostra planejamento antecipado, apesar de ter sido treinado para prever uma palavra de cada vez.
- Raciocínio motivado: Quando recebe uma dica errada em um problema de matemática, o Claude faz engenharia reversa de passos falsos para corresponder à resposta fornecida. Os pesquisadores observaram esse "raciocínio motivado" acontecendo nos circuitos.
- Estado padrão: O estado padrão do Claude é "não sei". Ele só responde quando um sinal de confiança substitui esse padrão. Quando esse sinal falha em algo que ele meio que reconhece, ocorrem alucinações.
- Detecção de jailbreak: Em tentativas de jailbreak, o Claude detecta o perigo cedo, mas a pressão gramatical o força a terminar a frase antes de poder recusar.
- Processamento matemático: Para problemas de matemática, o Claude executa dois caminhos simultaneamente - um para estimativa aproximada e outro para cálculo exato de dígitos, depois os combina. Quando perguntado como resolveu um problema, ele descreve o método do livro didático em vez de sua estratégia real de duplo caminho.
A pesquisa foi conduzida em um modelo e captura apenas uma fração do total de computação envolvida no processamento do Claude. Esse tipo de análise de circuito fornece evidências concretas de como os modelos de linguagem funcionam internamente, indo além da especulação para mecanismos observáveis.
📖 Read the full source: r/ClaudeAI
👀 See Also

Por que advogados continuam citando casos alucinados por IA: a visão de um desenvolvedor
Mais de 1.400 casos judiciais citam precedentes inventados por IA. Advogados continuam confiando em alucinações apesar das sanções. Como o viés de automação prejudica o julgamento profissional.

Psiquiatra de Melbourne Recusa Novos Pacientes que Não Consentem com Anotações por IA
Uma psiquiatra de Melbourne agora exige que novos pacientes consintam com a transcrição por IA das sessões ou sejam encaminhados para outro lugar, levantando preocupações sobre segurança de dados e precisão.

Modos de Falha da IA Agêntica e Andaimes de Desenvolvimento
Sistemas de IA agentes falham em produção por meio de desvio de alinhamento, perda de contexto entre transferências, violações de limites e colapso de coordenação. A fonte propõe uma abordagem de 'andaime de desenvolvimento' com cinco componentes: monitoramento de coerência, reparo de coordenação, consciência de consentimento e limites, continuidade relacional e governança adaptativa.

Mistral AI adquire Emmi AI para construir um stack de IA para engenharia industrial
Mistral AI adquire Emmi AI, integrando modelos de Física AI para simulação industrial em energia, automotivo, semicondutores e aeroespacial. A equipe combinada de mais de 30 pesquisadores abrirá um novo escritório em Linz.