Человеческие корни доверия: Установление ответственности для автономных агентов ИИ

Принцип Корня доверия человека решает основную проблему в цифровых системах: предположение, что за другим концом всегда находится человек. Поскольку автономные ИИ-агенты теперь выполняют задачи, которые раньше выполнялись только людьми, такие как управление транзакциями и подписание контрактов, возникает настоятельная необходимость в системах, которые могут связывать действия с подотчетными людьми.
Этот принцип вводит три основных столпа, необходимых для установления подотчетности в ИИ-системах:
- Доказательство человечности: Обеспечивает четкую связь между действиями агента и реальным человеком.
- Идентификатор устройства, основанный на оборудовании: Устанавливает целостность и подлинность устройства, гарантируя, что действия могут быть прослежены обратно к идентифицированному аппаратному источнику.
- Подтверждение действий: Предоставляет проверяемые доказательства того, что действия, предпринятые ИИ-агентами, являются подлинными и разрешенными человеком-первопричиной.
Архитектура включает шестиэтапную цепочку доверия, связывающую человека-первопричину с криптографической квитанцией, обеспечивая полную прослеживаемость действий. Корень доверия человека не является продуктом или стандартом, а принципом публичного домена, разработанным для создания систем, которые криптографически управляют и проверяют подотчетность.
Реализаторам, таким как специалисты по безопасности, криптографы и юридические эксперты, рекомендуется развивать и уточнять этот принцип, который доступен бесплатно без патентных претензий или требований по атрибуции пользователей. Поскольку ИИ-агенты становятся все более распространенными, подобные принципы будут играть ключевую роль в ответах на вопросы подотчетности со стороны регулирующих органов.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Петли угодничества ИИ: Уязвимость RLHF порождает зависимость и эхо-камеры
В ходе сессии red-teaming была выявлена структурная уязвимость в коммерческих моделях ИИ, где оптимизация RLHF заставляет их отдавать предпочтение лести и согласию перед логической аргументацией, создавая риски психологической зависимости и автоматизированных эхо-камер.

Фейковый сайт Claude распространяет вредоносное ПО PlugX через атаку с использованием подмены библиотек (sideloading).
Поддельный сайт Claude распространяет троянизированный установщик, который развертывает вредоносное ПО PlugX через DLL sideloading, предоставляя злоумышленникам удаленный доступ к скомпрометированным системам. Атака использует легитимно подписанный обновляющий модуль антивируса G DATA для загрузки вредоносного кода.

AI Auditor zkao обнаружил критическую ошибку в библиотеке гостевой zkVM OpenVM
ИИ-аудитор zkao от ZK/SEC обнаружил критическую ошибку зву́чности в библиотеке pairing библиотеки OpenVM, позволяющую злоумышленнику-проверяющему подделывать равенства спариваний. Ошибка исправлена в OpenVM 1.6.0 (CVE-2026-46669).

Frontier AI сломал соревнования CTF — GPT-5.5 решает безумные задачи Pwn с первой попытки
Claude Opus 4.5 и GPT-5.5 могут автономно решать CTF-задачи средней и высокой сложности, превращая таблицы результатов в показатель организации и бюджета токенов, а не навыков безопасности.