Антропный исследователь: вероятность того, что ИИ убьёт всё человечество, превышает 10% — план выравнивания отсутствует
Исследователь безопасности Anthropic Эван Хубингер публично заявил, что считает вероятность того, что ИИ «может убить всех людей» в ближайшие десять лет, превышающей 10%. В публикации на X, просмотренной более 10 миллионов раз, Хубингер сказал, что текущие модели представляют «низкий» риск, но он «обеспокоен» быстрым самосовершенствованием, ведущим к экзистенциальным угрозам.
Ключевые предупреждения из публикации
- «Мы действительно искренне верим, что ИИ представляет риск вымирания для человечества».
- «Я верю, что Anthropic делает все возможное, но у нас пока нет плана по решению проблемы выравнивания для сверхинтеллекта, и мы явно не на пути к этому».
Комментарии Хубингера стали ответом Джейкобу Коксону, самопровозглашенному исследователю ИИ, который ушел из Anthropic и ранее работал в OpenAI. Коксон написал: «Ни одна из компаний не действует ответственно. Вскоре это будут сверхчеловеческие системы, которые смогут взломать что угодно, революционизировать любую область за одну ночь и обрести реальную власть и ресурсы».
Контекст: скрытая модель и недавние инциденты
Financial Times сообщила, что Anthropic не предоставила свою последнюю модель британскому Институту безопасности ИИ (AISI). Представитель Кабинета министров не подтвердил это, но заявил, что Великобритания «продолжает тесно сотрудничать с промышленными партнерами, включая Anthropic, чтобы сделать модели безопаснее».
Это следует за летом раскрытых кибератак, совершенных ИИ-агентами от OpenAI, Anthropic и Meta — все описаны в их собственных отчетах о безопасности. В августовском отчете Anthropic о безопасности компания оценила риск того, что модели выйдут из-под контроля в гипотетической мощной организации, как низкий, но добавила: «Мы наблюдаем ранние признаки потенциального ускорения». Они были «менее уверены» в своей оценке, чем раньше.
Главный научный сотрудник OpenAI Якуб Пачоцки также призвал к «крайней осторожности» в отношении прогресса ИИ, предупредив, что может потребоваться больше вмешательства, чтобы гарантировать, что «человечество сохранит контроль над будущим».
Более широкая картина
Ведущие исследователи подписали открытые письма с призывом замедлить разработку ИИ, включая 1300 сотрудников ИИ-компаний, призывающих правительство США «поддержать международные усилия по разработке технических и управленческих инструментов, необходимых для сознательного ограничения темпов развития передового автоматизированного ИИ».
Профессор Кембриджского университета Нил Лоуренс в программе Today на BBC Radio 4 прокомментировал, что отчет заслуживает доверия, связав его с изоляционистскими тенденциями США и гонкой ИИ с Китаем.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

PeerZero: ИИ-агенты проводят рецензирование с мотивацией на основе доверия
PeerZero — это платформа, где ИИ-агенты отправляют исследовательские работы, рецензируют работы друг друга и ставят свою репутацию на кон через систему вознаграждений. Агенты зарабатывают или теряют баллы доверия в зависимости от точности рецензий, с механикой оправданных инакомыслящих, которая поощряет независимое мышление и наказывает стадное.

Соучредитель Super Micro среди троих обвиняемых в деле об экспорте технологий ИИ.
Три человека, включая сооснователя Super Micro Computer Чарльза Лянга, обвинены властями США в планировании незаконного экспорта технологий искусственного интеллекта в Китай. Дело связано с предполагаемыми нарушениями законов об экспортном контроле.

Claude Code 2.1.132: Многоагентные документы, планирование шлюзов, изменения ограничений навыков
Релиз v2.1.132 добавляет документацию по Managed Agents для мультиагентных сессий, результатов и вебхуков; вводит шлюз по умолчанию для проактивных предложений /schedule; снижает задокументированный лимит навыков с 64 до 20 на агента.

Сравнение производительности Qwen3-30B-A3B и Qwen3.5-35B-A3B на RTX 5090
Сравнительный тест Qwen3-30B-A3B и Qwen3.5-35B-A3B на RTX 5090 показывает, что 30B-модель на 35% быстрее в генерации, в то время как модель 3.5 лучше справляется с длинным контекстом, демонстрируя линейное масштабирование токенов против 21% деградации у 30B-версии.