Два подхода к снижению риска утечки данных при использовании ИИ-агентов

Обсуждение на r/LocalLLaMA поднимает вопросы конфиденциальности данных при использовании сторонних платформ для запуска ИИ-агентов и предлагает две конкретные стратегии для их решения.
Вариант 1: Используйте собственные API-ключи
В источнике говорится, что многие платформы для агентов выступают в роли посредников, подключая пользователей к провайдерам, таким как OpenAI или Anthropic, при этом взимая наценку и потенциально получая доступ к пользовательским данным. Чтобы обойти это:
- Создайте аккаунт на platform.openai.com или console.anthropic.com
- Сгенерируйте новый API-ключ
- Вставьте этот ключ напрямую в ваш инструмент для агента вместо использования подписки на платформе
Этот подход исключает доступ дополнительной платформы к вашим данным и убирает их наценку, хотя данные всё равно отправляются компании-разработчику ИИ (OpenAI, Anthropic, Minimax и т.д.).
Вариант 2: Запускайте всё локально
Для максимальной конфиденциальности, особенно при работе с конфиденциальной информацией клиентов, вы можете запускать модели ИИ полностью на своём компьютере.
- Используйте Ollama для загрузки и запуска моделей ИИ с открытым исходным кодом на собственном оборудовании. В источнике отмечается, что с этим справится даже MacBook Air 2018 года.
- Соедините модель с фреймворком для агентов, таким как OpenClaw (теперь принадлежит OpenAI), чтобы обеспечить выполнение многошаговых задач, использование инструментов (браузер, файлы, API), контекстную память и автоматизацию.
Рекомендуемые практики настройки
В посте предлагается контейнеризировать ваш стек с помощью Docker Compose, чтобы упаковать всю настройку (модель ИИ, фреймворк агента, уровень памяти, такой как Redis или векторная база данных, и опциональный обратный прокси) для удобного развёртывания и обслуживания.
Также подчёркивается важность ограничения возможностей агента путём разделения задач по уровням доверия:
- Безопасные: чтение, суммирование, составление черновиков
- Ограниченные: отправка сообщений, доступ к файлам
- Рискованные: любые действия, которые что-то изменяют или удаляют
Ничего из категории «рискованные» не должно выполняться без предварительного ручного подтверждения. Как только этот фундамент будет надёжно установлен, вы сможете добавлять инструменты, такие как веб-сёрфинг, Telegram, электронная почта и запланированные рабочие процессы.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Агент ИИ использует SQL-инъекцию для взлома чат-бота McKinsey Lilli
Исследователи безопасности из CodeWall использовали автономного ИИ-агента для взлома внутреннего чат-бота Lilli компании McKinsey, получив полный доступ на чтение и запись к его производственной базе данных за два часа через уязвимость SQL-инъекции в незащищённых API-эндпоинтах.

Agent-Drift: инструмент мониторинга безопасности для AI-агентов

PolyRange: Устойчивый к загрязнению бенчмарк для атакующего ИИ с целями, сгенерированными LLM
PolyRange v1.0 — это бенчмарк с лицензией MIT, который можно разместить самостоятельно. Он генерирует свежие веб-цели для каждого запуска, чтобы предотвратить загрязнение обучающих данных. Включает 84 класса, производных от WSTG, по всем категориям OWASP, два уровня защиты и реальные бэкенды.

Claude Code — уязвимость с опасным пропуском проверки прав и инструмент защиты с открытым исходным кодом
Lasso Security опубликовала исследование, демонстрирующее уязвимости косвенной инъекции промптов в Claude Code при использовании флага --dangerously-skip-permissions, включая векторы атак через отравленные файлы README, вредоносный веб-контент и выводы MCP-серверов. Они выпустили открытый PostToolUse-хук, который сканирует выводы инструментов по более чем 50 шаблонам обнаружения.