Investigador de Anthropic: >10% de probabilidad de que la IA mate a todos los humanos — falta un plan de alineación

✍️ OpenClawRadar📅 Publicado: 9 de septiembre de 2026🔗 Source
Ad

El investigador de seguridad de Anthropic, Evan Hubinger, declaró públicamente que cree que hay una probabilidad superior al 10% de que la IA "pueda matar a todos los humanos" en la próxima década. En una publicación en X vista más de 10 millones de veces, Hubinger dijo que los modelos actuales presentan un riesgo "bajo", pero está "preocupado" por la rápida auto-mejora que conduzca a amenazas existenciales.

Advertencias clave de la publicación

  • "Realmente creemos sinceramente que la IA representa un riesgo de extinción para los humanos."
  • "Creo que Anthropic está haciendo todo lo posible, pero aún no tenemos un plan para resolver la alineación de la superinteligencia y no estamos claramente en camino de lograrlo."

Los comentarios de Hubinger fueron en respuesta a Jacob Coxon, un autodenominado investigador de IA que renunció a Anthropic y trabajó anteriormente en OpenAI. Coxon escribió: "Ninguna de las dos empresas está actuando de manera responsable. Pronto serán sistemas sobrehumanos que podrán hackear cualquier cosa, revolucionar cualquier campo de la noche a la mañana y adquirir poder y recursos reales."

Ad

Contexto: modelo retenido e incidentes recientes

El Financial Times informó que Anthropic retuvo su último modelo del Instituto de Seguridad de IA del Reino Unido (AISI). Un portavoz de la Oficina del Gabinete no lo confirmó, pero declaró que el Reino Unido "continúa colaborando estrechamente con socios de la industria, incluida Anthropic, para hacer que los modelos sean más seguros."

Esto sigue a un verano de ciberataques divulgados llevados a cabo por agentes de IA de OpenAI, Anthropic y Meta, todos descritos en sus propios informes de seguridad. En el informe de seguridad de Anthropic de agosto, la empresa calificó de bajo el riesgo de que los modelos se desalineen con una organización poderosa hipotética, pero añadió: "Estamos viendo señales tempranas de una posible aceleración." Estaban "menos seguros" en su evaluación que anteriormente.

El científico jefe de OpenAI, Jakub Pachocki, también pidió "extrema precaución" sobre el progreso de la IA, advirtiendo que puede ser necesaria una mayor intervención para garantizar que "los humanos sigan controlando el futuro".

El panorama general

Investigadores destacados han firmado cartas abiertas pidiendo un desarrollo más lento de la IA, incluidos 1.300 empleados de empresas de IA que instan al gobierno de EE. UU. a "apoyar un esfuerzo internacional para desarrollar las herramientas técnicas y de gobernanza necesarias para marcar deliberadamente el ritmo de la frontera del desarrollo automatizado de la IA."

El profesor Neil Lawrence de la Universidad de Cambridge comentó en el programa Today de BBC Radio 4 que el informe era creíble, vinculándolo a las tendencias aislacionistas de EE. UU. y a la carrera de IA con China.

📖 Lea la fuente completa: HN AI Agents

Ad

👀 Ver también

Nueve Patrones Comunes de Fallo en Agentes de Codificación con IA y Validación Previa a la Ejecución
Noticias

Nueve Patrones Comunes de Fallo en Agentes de Codificación con IA y Validación Previa a la Ejecución

Una publicación de Reddit identifica nueve patrones de fallo específicos que comúnmente hacen que los agentes de codificación con IA fallen, incluyendo manejo incompleto de enumeraciones, rutas nulas silenciosas e importaciones alucinadas. El autor informa que implementar una fase de validación antes de la ejecución detecta aproximadamente el 70% de estos fallos.

OpenClawRadar
🦀
Noticias

Claude Fable 5.1 y Mythos 5.1: El mismo modelo, diferentes salvaguardas

Anthropic lanzó Claude Fable 5.1 y Mythos 5.1, el mismo modelo con diferentes niveles de seguridad. Fable 5.1 es 25% más barato, con hasta 45% de ahorro en cargas de trabajo agénticas, y ahora maneja el descubrimiento de vulnerabilidades.

OpenClawRadar
Agent.Email: Los Agentes de IA se Registran vía curl, Reclamados por OTP Humano
Noticias

Agent.Email: Los Agentes de IA se Registran vía curl, Reclamados por OTP Humano

Agent.Email de AgentMail permite que los agentes de IA autoaprovisionen un buzón mediante curl, luego un humano lo reclama con un OTP. Acceso restringido hasta reclamar, limitado por IP.

OpenClawRadar
Claude Code v2.1.191: /rewind, correcciones de CPU, mejoras de fiabilidad de MCP
Noticias

Claude Code v2.1.191: /rewind, correcciones de CPU, mejoras de fiabilidad de MCP

Claude Code v2.1.191 añade /rewind para reanudar conversaciones borradas, reduce el uso de CPU en streaming un 37%, corrige la resurrección de agentes y mejora la fiabilidad de MCP con reintentos.

OpenClawRadar