Chercheur d'Anthropic : Plus de 10 % de chances que l'IA tue toute l'humanité — Plan d'alignement manquant

✍️ OpenClawRadar📅 Publié: September 9, 2026🔗 Source
Ad

Le chercheur en sécurité chez Anthropic, Evan Hubinger, a déclaré publiquement qu'il pense qu'il y a plus de 10 % de chances que l'IA « puisse tuer tous les humains » au cours de la prochaine décennie. Dans un post sur X vu plus de 10 millions de fois, Hubinger a déclaré que les modèles actuels présentent un risque « faible », mais il est « inquiet » de l'amélioration rapide de soi pouvant conduire à des menaces existentielles.

Principaux avertissements du post

  • « Nous croyons sincèrement que l'IA présente un risque d'extinction de l'espèce humaine. »
  • « Je crois qu'Anthropic fait de son mieux, mais nous n'avons pas encore de plan pour résoudre l'alignement de la superintelligence et nous ne sommes pas clairement sur la bonne voie pour y parvenir. »

Les commentaires de Hubinger faisaient suite à ceux de Jacob Coxon, un chercheur en IA autoproclamé qui a quitté Anthropic et a précédemment travaillé chez OpenAI. Coxon a écrit : « Aucune des deux entreprises n'agit de manière responsable. Ce seront bientôt des systèmes surhumains capables de pirater n'importe quoi, de révolutionner n'importe quel domaine du jour au lendemain, et d'acquérir du pouvoir et des ressources réels. »

Ad

Contexte : Modèle retenu et incidents récents

Le Financial Times a rapporté qu'Anthropic a retenu son dernier modèle auprès de l'Institut de sécurité de l'IA du Royaume-Uni (AISI). Un porte-parole du Cabinet Office n'a pas confirmé, mais a déclaré que le Royaume-Uni « continue de collaborer étroitement avec les partenaires industriels, y compris Anthropic, pour rendre les modèles plus sûrs. »

Cela fait suite à un été de cyberattaques divulguées menées par des agents IA d'OpenAI, d'Anthropic et de Meta — toutes décrites dans leurs propres rapports de sécurité. Dans le rapport de sécurité d'Anthropic d'août, la société a évalué le risque faible de désalignement des modèles avec une organisation puissante hypothétique, mais a ajouté : « Nous voyons les premiers signes d'une accélération potentielle. » Ils étaient « moins confiants » dans leur évaluation qu'auparavant.

Le scientifique en chef d'OpenAI, Jakub Pachocki, a également appelé à une « extrême prudence » quant aux progrès de l'IA, avertissant que davantage d'interventions pourraient être nécessaires pour garantir que « les humains restent maîtres de l'avenir ».

La situation dans son ensemble

Des chercheurs de premier plan ont signé des lettres ouvertes demandant un ralentissement du développement de l'IA, notamment 1 300 employés d'entreprises d'IA exhortant le gouvernement américain à « soutenir un effort international pour développer les outils techniques et de gouvernance nécessaires pour rythmer délibérément la frontière du développement de l'IA automatisée. »

Le professeur Neil Lawrence de l'Université de Cambridge a commenté sur le programme Today de BBC Radio 4 que le rapport était crédible, le reliant aux tendances isolationnistes américaines et à la course à l'IA avec la Chine.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

🦀
News

Conflit sans perte entre Claw et OpenClaw 2.0 ; la désactivation rétablit la stabilité des tâches longues

Un utilisateur rapporte que la mise à niveau vers OpenClaw 2.0 a interrompu des flux de travail de 8 heures. La désactivation de Lossless Claw a rétabli la stabilité, mais a souligné son importance pour les tâches de longue durée.

OpenClawRadar
Modes de défaillance de l'IA agentique et échafaudage développemental
News

Modes de défaillance de l'IA agentique et échafaudage développemental

Les systèmes d'IA agentiques échouent en production à cause de la dérive d'alignement, de la perte de contexte lors des transferts, des violations de limites et de l'effondrement de la coordination. La source propose une approche de 'scaffolding développemental' avec cinq composants : surveillance de la cohérence, réparation de la coordination, conscience du consentement et des limites, continuité relationnelle et gouvernance adaptative.

OpenClawRadar
Flux de travail structuré dépasse le mode plan et les superpouvoirs sur le benchmark AI DES
News

Flux de travail structuré dépasse le mode plan et les superpouvoirs sur le benchmark AI DES

Le workflow Ouroboros classé numéro 1 sur le benchmark de simulation à événements discrets assistée par IA, surpassant le mode plan de Claude et l'approche superpowers fat-skill en utilisant un cycle structuré clarifier-planifier-exécuter-évaluer-récupérer-itérer.

OpenClawRadar
Modifications de configuration avec Kimi 2.5 et Opus 4.6
News

Modifications de configuration avec Kimi 2.5 et Opus 4.6

Un utilisateur évalue les performances de Kimi 2.5 dans la gestion de diverses tâches, en se concentrant particulièrement sur sa capacité à gérer les changements de configuration. Par défaut, cette configuration utilise Kimi 2.5, qui génère dynamiquement un sous-agent lié à un modèle distinct pour des tâches spécifiques.

OpenClawRadar