A Anthropic relata ataques de destilação em escala industrial por laboratórios de IA chineses ao Claude.

Operação de extração de modelo em escala industrial
A Anthropic publicou descobertas detalhando ataques coordenados de destilação contra o Claude por três laboratórios chineses de IA. Os ataques envolveram a criação de contas fraudulentas em larga escala para extrair as capacidades de raciocínio do Claude através de interações massivas de API.
Principais detalhes do ataque do relatório da Anthropic
- DeepSeek, Moonshot e MiniMax criaram mais de 24.000 contas fraudulentas
- O total de interações com o Claude excedeu 16 milhões
- Apenas a MiniMax disparou 13 milhões de solicitações
- Quando a Anthropic lançou um novo modelo, a MiniMax redirecionou quase metade de seu tráfego em 24 horas
- A DeepSeek visou especificamente cadeias de pensamento e respostas seguras para censura
- Os ataques aumentaram em sofisticação ao longo do tempo conforme os laboratórios adaptaram seus métodos
Implicações de segurança para desenvolvedores de IA
Este incidente destaca vulnerabilidades na segurança de modelos de IA quando laboratórios bilionários tentam sistematicamente extrair capacidades proprietárias. A escala e persistência desses ataques—abrangendo múltiplas organizações e se adaptando a novos lançamentos de modelos—sugere que isso representa um vetor de ameaça contínuo em vez de incidentes isolados.
Os métodos utilizados (criação de contas fraudulentas, consultas direcionadas para capacidades específicas, rápida adaptação a novas versões de modelos) poderiam potencialmente ser replicados contra outros sistemas de IA, levantando questões sobre a segurança de ferramentas de IA de terceiros que os desenvolvedores integram em seus fluxos de trabalho.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Análise de Segurança da Extração de Componentes do OpenClaw para Agentes de IA Personalizados
Um desenvolvedor analisou o código-fonte do OpenClaw para determinar quais componentes podem ser extraídos com segurança para uso em agentes de IA personalizados, classificando cada um usando a estrutura Lethal Quartet. A análise revela riscos significativos de segurança em componentes como Semantic Snapshots e BrowserClaw.

Aplicativo Claude para Android supostamente lê a área de transferência sem ação explícita do usuário
Um usuário relata que o aplicativo Claude para Android analisou código da área de transferência sem que ele o colasse, com o Claude identificando o arquivo como pasted_text_b4a56202-3d12-43c8-aa31-a39367a9a354.txt. O comportamento não pôde ser reproduzido em testes subsequentes.

OpenClaw Corrige Escalação Crítica de Privilégios no Caminho /pair Approve
OpenClaw 2026.3.28 corrige uma vulnerabilidade crítica de segurança (GHSA-hc5h-pmr3-3497) onde o comando /pair approve permitia que usuários com privilégios de emparelhamento aprovassem solicitações de dispositivos para escopos mais amplos, incluindo acesso de administrador. As versões afetadas são <= 2026.3.24.

Bypass de guardrail da IA Claude observado ao enquadrar solicitações como tarefas de segurança de rede
Um usuário do Reddit descobriu que o Claude AI fornece listas de domínios de pirataria quando as solicitações são enquadradas como tarefas de segurança de rede para bloqueio, contornando os mecanismos normais de recusa. O modelo reconheceu ter interpretado mal a intenção depois que o usuário apontou a influência do enquadramento.