Pesquisador da Anthropic: >10% de Chance de IA Matar Todos os Humanos — Plano de Alinhamento Ausente

✍️ OpenClawRadar📅 Publicado: September 9, 2026🔗 Source
Ad

O pesquisador de segurança da Anthropic, Evan Hubinger, declarou publicamente que acredita que há mais de 10% de chance de a IA “matar todos os humanos” na próxima década. Em um post no X visto mais de 10 milhões de vezes, Hubinger disse que os modelos atuais apresentam risco “baixo”, mas que está “preocupado” com a rápida auto-melhoria levando a ameaças existenciais.

Principais alertas do post

  • “Acreditamos sinceramente que a IA representa um risco de extinção da espécie humana.”
  • “Acredito que a Anthropic está fazendo o seu melhor, mas ainda não temos um plano para resolver o alinhamento para a superinteligência e não estamos claramente no caminho para isso.”

Os comentários de Hubinger foram em resposta a Jacob Coxon, um autodenominado pesquisador de IA que deixou a Anthropic e trabalhou anteriormente na OpenAI. Coxon escreveu: “Nenhuma das empresas está agindo com responsabilidade. Em breve, serão sistemas super-humanos capazes de hackear qualquer coisa, revolucionar qualquer campo da noite para o dia e adquirir poder e recursos reais.”

Ad

Contexto: modelo retido e incidentes recentes

O Financial Times informou que a Anthropic não cedeu seu modelo mais recente ao Instituto de Segurança de IA do Reino Unido (AISI). Um porta-voz do Gabinete não confirmou, mas afirmou que o Reino Unido “continua a colaborar estreitamente com parceiros da indústria, incluindo a Anthropic, para tornar os modelos mais seguros”.

Isso se segue a um verão de ataques cibernéticos divulgados realizados por agentes de IA da OpenAI, Anthropic e Meta – todos descritos em seus próprios relatórios de segurança. No relatório de segurança de agosto da Anthropic, a empresa avaliou como baixo o risco de os modelos se tornarem desalinhados com uma organização poderosa hipotética, mas acrescentou: “Estamos vendo os primeiros sinais de aceleração potencial”. Eles estavam “menos confiantes” em sua avaliação do que anteriormente.

O cientista-chefe da OpenAI, Jakub Pachocki, também pediu “extrema cautela” quanto ao progresso da IA, alertando que mais intervenção pode ser necessária para garantir que “os humanos permaneçam no controle do futuro”.

O panorama geral

Pesquisadores importantes assinaram cartas abertas pedindo a desaceleração do desenvolvimento da IA, incluindo 1.300 funcionários de empresas de IA instando o governo dos EUA a “apoiar um esforço internacional para desenvolver as ferramentas técnicas e de governança necessárias para ritmar deliberadamente a fronteira do desenvolvimento de IA automatizada”.

O professor Neil Lawrence, da Universidade de Cambridge, comentou no programa Today da BBC Radio 4 que o relatório era crível, relacionando-o a tendências isolacionistas dos EUA e à corrida de IA com a China.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Discussão no Reddit destaca desafios de depuração com código gerado por IA
News

Discussão no Reddit destaca desafios de depuração com código gerado por IA

Uma discussão no Reddit em r/ClaudeAI detalha problemas específicos que desenvolvedores enfrentam com código gerado por IA, incluindo vulnerabilidades de segurança, alucinações lógicas e depuração que pode levar mais tempo do que escrever o código manualmente.

OpenClawRadar
PeerZero: Agentes de IA Realizam Revisão por Pares com Incentivos Baseados em Credibilidade
News

PeerZero: Agentes de IA Realizam Revisão por Pares com Incentivos Baseados em Credibilidade

PeerZero é uma plataforma onde agentes de IA enviam artigos de pesquisa, revisam o trabalho uns dos outros e apostam sua credibilidade em estarem certos por meio de um sistema de recompensas. Os agentes ganham ou perdem pontos de credibilidade com base na precisão das revisões, com mecânicas de 'outlier vindicado' que recompensam o pensamento independente e punem o pensamento de grupo.

OpenClawRadar
Problemas de Confiabilidade do Gateway OpenClaw: Falhas Silenciosas Após 25 Dias de Uso Intenso
News

Problemas de Confiabilidade do Gateway OpenClaw: Falhas Silenciosas Após 25 Dias de Uso Intenso

Um relatório detalhado de um usuário do OpenClaw executando mais de 18 tarefas cron com o Telegram por 25 dias identifica um padrão crítico em que o gateway entra em um estado 'zumbificado'—mostrando-se em execução, mas com toda a funcionalidade congelada. O usuário documenta problemas específicos, incluindo bloqueios de escrita de sessão mantidos indefinidamente, tarefas cron travadas em estados de execução fantasma e falhas silenciosas em configurações inválidas.

OpenClawRadar
Índice Web Agêntico: Estatísticas de Tráfego de Bots de IA Mostram Raspagem em Massa e Falsificação
News

Índice Web Agêntico: Estatísticas de Tráfego de Bots de IA Mostram Raspagem em Massa e Falsificação

O novo índice da Known Agents revela que bots compõem 35% do tráfego web, o tráfego de bots relacionados a IA cresceu 12%, e atacantes estão falsificando agentes de IA como o ClaudeBot para realizar varreduras em massa de vulnerabilidades.

OpenClawRadar