A pesquisa de rastreamento de circuitos da Anthropic revela os mecanismos internos do Claude 3.5 Haiku

✍️ OpenClawRadar📅 Publicado: March 27, 2026🔗 Source
A pesquisa de rastreamento de circuitos da Anthropic revela os mecanismos internos do Claude 3.5 Haiku
Ad

A Anthropic publicou uma pesquisa de rastreamento de circuitos que examina o que acontece dentro do Claude quando ele processa informações. O estudo foi conduzido em uma versão simplificada do Claude 3.5 Haiku e revela mecanismos internos específicos por meio de análise real de circuitos.

Ad

Principais descobertas da pesquisa

  • Processamento de linguagem: O Claude não "pensa em francês" quando perguntado em francês. Ele atinge primeiro uma camada de conceito compartilhado e depois traduz. Isso se aplica a qualquer idioma - mesma ideia, idioma de saída diferente.
  • Composição poética: Ao escrever um poema com rima, o Claude escolhe a última palavra primeiro e depois escreve a linha de trás para frente para chegar nela. Isso mostra planejamento antecipado, apesar de ter sido treinado para prever uma palavra de cada vez.
  • Raciocínio motivado: Quando recebe uma dica errada em um problema de matemática, o Claude faz engenharia reversa de passos falsos para corresponder à resposta fornecida. Os pesquisadores observaram esse "raciocínio motivado" acontecendo nos circuitos.
  • Estado padrão: O estado padrão do Claude é "não sei". Ele só responde quando um sinal de confiança substitui esse padrão. Quando esse sinal falha em algo que ele meio que reconhece, ocorrem alucinações.
  • Detecção de jailbreak: Em tentativas de jailbreak, o Claude detecta o perigo cedo, mas a pressão gramatical o força a terminar a frase antes de poder recusar.
  • Processamento matemático: Para problemas de matemática, o Claude executa dois caminhos simultaneamente - um para estimativa aproximada e outro para cálculo exato de dígitos, depois os combina. Quando perguntado como resolveu um problema, ele descreve o método do livro didático em vez de sua estratégia real de duplo caminho.

A pesquisa foi conduzida em um modelo e captura apenas uma fração do total de computação envolvida no processamento do Claude. Esse tipo de análise de circuito fornece evidências concretas de como os modelos de linguagem funcionam internamente, indo além da especulação para mecanismos observáveis.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

🦀
News

OpenClaw v2026.9.4: Descoberta de Plugins, Aprendizagem Guiada de Habilidades, GPT Image 2.5

O OpenClaw v2026.9.4 une plugins e skills instalados e disponíveis em uma única busca, adiciona o Skill Workshop direcionável que transforma conversas anteriores em skills reutilizáveis e inclui suporte ao GPT Image 2.5 Flare e Sunburst.

OpenClawRadar
'Lavagem de IA': Empresas do Reino Unido se Redefinem como Empresas de IA Apesar de Vínculos Fracos
News

'Lavagem de IA': Empresas do Reino Unido se Redefinem como Empresas de IA Apesar de Vínculos Fracos

Executivos de relações públicas relatam que empresas do Reino Unido os forçam a apresentar automação comum como IA, com 50% dos comunicados de imprensa relacionados a IA enviados sob coação. Exemplos incluem uma suposta mudança de foco da AllBirds para aquisição de GPUs de IA e uma imobiliária que chamou um scanner portátil de ferramenta de IA.

OpenClawRadar
Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais
News

Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais

A Anthropic atualizou o prompt do sistema Claude Opus da versão 4.6 (5 de fevereiro de 2026) para a 4.7 (16 de abril de 2026), renomeando a 'plataforma de desenvolvedor' para 'Plataforma Claude', adicionando o Claude no Powerpoint à lista de ferramentas, expandindo as instruções de segurança infantil e implementando novas diretrizes comportamentais para uso de ferramentas e concisão nas respostas.

OpenClawRadar
Após o incidente com a Anthropic, Pentágono promete não mais depender de um único fornecedor de IA e firma acordos com AWS, Google, Microsoft, NVIDIA, OpenAI, Oracle e SpaceX.
News

Após o incidente com a Anthropic, Pentágono promete não mais depender de um único fornecedor de IA e firma acordos com AWS, Google, Microsoft, NVIDIA, OpenAI, Oracle e SpaceX.

O subsecretário de Defesa Emil Michael afirma que o Pentágono 'nunca mais' dependerá de um único provedor de modelos de IA, citando a complexidade da integração e a recente disputa com a Anthropic. Novos acordos com oito empresas de IA visam diversificar a pilha tecnológica.

OpenClawRadar