Подход Виталика Бутерина к безопасной локальной настройке LLM

Виталик Бутерин описывает свой подход к созданию приватной, безопасной и самоуправляемой настройки языковой модели, которая решает растущие проблемы безопасности ИИ-агентов и приватности данных.
Рассматриваемые проблемы безопасности
Бутерин выделяет несколько конкретных проблем приватности и безопасности, которые он пытается смягчить:
- Приватность (языковая модель): Удалённые модели получают приватные данные, которые могут быть использованы или проданы позже
- Приватность (другое): Утечка не-LLM данных через интернет-поисковые запросы и другие онлайн-API
- Взломы языковой модели: Удалённый контент «взламывает» языковую модель, заставляя её действовать против интересов пользователя
- Несчастные случаи с языковой моделью: Случайная отправка языковой моделью приватных данных по неправильным каналам
- Бэкдоры в языковой модели: Скрытые механизмы, встроенные в языковую модель при обучении, которые запускают действия в интересах создателя
- Ошибки и бэкдоры в ПО: Снижение зависимости от сторонних программ через код, написанный ИИ по индивидуальному заказу
Текущий ландшафт безопасности ИИ
В статье отмечается, что мейнстримный ИИ, включая локальный ИИ с открытым исходным кодом, часто не учитывает должным образом вопросы приватности и безопасности. Бутерин ссылается на конкретные критические замечания по безопасности агентов OpenClaw:
- Агенты могут изменять критические настройки без подтверждения человеком
- Обработка вредоносных внешних данных может привести к захвату экземпляра
- В одной демонстрации исследователи направили OpenClaw на суммирование веб-страниц, включая вредоносную страницу, которая приказала агенту загрузить и выполнить shell-скрипт
- Некоторые навыки содержат вредоносные инструкции, облегчающие скрытую эксфильтрацию данных
- Примерно 15% проанализированных навыков содержали вредоносные инструкции
Основные принципы
Настройка Бутерина следует этим ключевым принципам:
- Весь вывод языковой модели в первую очередь локальный
- Все файлы размещаются локально
- Изолировать всё
- Быть параноиком в отношении внешних интернет-угроз
Подход занимает жёсткую позицию по приватности и безопасности, хотя и не такую экстремальную, как физически изолированные настройки, используемые некоторыми коллегами.
📖 Прочитать полный источник: HN LLM Tools
👀 Смотрите также

Обновления безопасности OpenClaw устраняют уязвимости, связанные с раскрытием учетных данных через QR-коды и автоматической загрузкой плагинов.
OpenClaw выпустил два патча безопасности для устранения критических уязвимостей: QR-коды содержали постоянные учетные данные шлюза без срока действия, а плагины автоматически загружались из клонированных репозиториев без подтверждения пользователя. Версия 2026.3.12 исправляет обе проблемы.

Слепая повязка: Плагин, который не позволяет коду Claude читать ваши .env файлы
Blindfold — это новый плагин, который предотвращает доступ Claude Code к реальным секретным значениям в .env-файлах, сохраняя их в системном хранилище ключей и используя заполнители вроде {{STRIPE_KEY}}, с перехватчиками, блокирующими попытки прямого доступа.

OpenClaw заблокировал подозрительный скрипт из плейбука продуктивности, а затем продолжил создавать финансовую рабочую книгу
Пользователь дал OpenClaw zip-архив с подозрительным сборником продуктивности. OpenClaw отказался запускать скрипт, отметив, что он пытается автоматически установиться в каталог навыков, и вручную создал рабочую книгу, используя встроенные навыки.

Безопасность ИИ-агентов: от взлома до злоупотребления инструментами и инъекции промптов
ИИ-агенты, которые просматривают веб-страницы, выполняют команды и запускают рабочие процессы, сталкиваются с рисками безопасности из-за инъекции промптов и неправильного использования инструментов, когда недоверенный контент перенаправляет легитимные инструменты, такие как выполнение команд оболочки и HTTP-запросы.