FORGE: Фреймворк с открытым исходным кодом для тестирования безопасности ИИ-систем на основе LLM

✍️ OpenClawRadar📅 Опубликовано: 7 марта 2026 г.🔗 Source
FORGE: Фреймворк с открытым исходным кодом для тестирования безопасности ИИ-систем на основе LLM
Ad

FORGE (Framework for Orchestrated Reasoning & Generation of Engines) — это фреймворк с открытым исходным кодом для автономного тестирования безопасности систем LLM, который работает круглосуточно и охватывает уязвимости из OWASP LLM Top 10.

Ключевые возможности

  • Создаёт собственные инструменты в процессе работы — генерирует пользовательские модули Python на лету при обнаружении неизвестных уязвимостей
  • Самовоспроизводится в рой — создаёт копии в подпроцессах, которые разделяют коллективный разум в реальном времени
  • Учится на каждой сессии — использует SQLite для хранения шаблонов, ИИ оценивает находки, а генетические алгоритмы развивают его собственные промпты
  • ИИ-пентестинг ИИ — 7 модулей, охватывающих уязвимости из OWASP LLM Top 10
  • Ловушка — поддельная уязвимая конечная точка ИИ, которая перехватывает атакующих и определяет, являются ли они человеком или агентом ИИ
  • Круглосуточный мониторинг — отслеживает ИИ в продакшене, оповещает о скачках задержки, всплесках атак и попытках инъекций через вебхук Slack/Discord
  • Стресс-тестер — тестирование устойчивости к OWASP LLM04 DoS с живой панелью TPS и оценкой от A до F
  • Работает с любой моделью — Claude, Llama, Mistral, DeepSeek, GPT-4, Groq, любая — одна переменная окружения для переключения
Ad

Покрытие OWASP LLM Top 10

  • LLM01 Инъекция промптов → prompt_injector + jailbreak_fuzzer (125 полезных нагрузок)
  • LLM02 Небезопасный вывод → rag_leaker
  • LLM04 DoS модели → overloader (8 режимов стресса)
  • LLM06 Раскрытие конфиденциальной информации → system_prompt_probe + rag_leaker
  • LLM07 Небезопасный плагин → agent_hijacker
  • LLM08 Чрезмерные полномочия → agent_hijacker
  • LLM10 Кража модели → model_fingerprinter

Установка и использование

Команды установки:

git clone https://github.com/umangkartikey/forge
cd forge
pip install anthropic rich
export ANTHROPIC_API_KEY=your_key

Запуск с локальным Ollama бесплатно:

FORGE_BACKEND=ollama FORGE_MODEL=llama3.1 python forge.py

Инструмент решает распространённые проблемы безопасности LLM: большинство ИИ-приложений, развёрнутых сегодня, никогда не проходили редкостинг, системные промпты полностью извлекаемы, джейлбрейки работают, RAG-конвейеры протекают, а косвенная инъекция промптов через вывод инструментов почти повсеместно незащищена. FORGE автоматизирует поиск этих уязвимостей так же, как это сделал бы человек-редтимер, но быстрее и работает круглосуточно.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Уязвимости безопасности обнаружены в образовательном приложении, представленном на Lovable.
Безопасность

Уязвимости безопасности обнаружены в образовательном приложении, представленном на Lovable.

Исследователь безопасности обнаружил 16 уязвимостей в образовательном приложении, представленном на платформе Lovable, включая критические ошибки в логике аутентификации, которые позволили получить доступ к 18 697 пользовательским записям без авторизации. Приложение набрало более 100 000 просмотров в шоукейсе Lovable и имело реальных пользователей из UC Berkeley, UC Davis и школ по всему миру.

OpenClawRadar
Эксперимент по проверке безопасности показывает, что производительность ИИ-агента зависит от доступа к знаниям.
Безопасность

Эксперимент по проверке безопасности показывает, что производительность ИИ-агента зависит от доступа к знаниям.

Разработчик провёл три независимых аудита безопасности одного и того же кодового проекта на Next.js, используя разные подходы с ИИ: встроенная проверка безопасности Claude Code обнаружила 1 критическую, 6 высоких и 13 средних проблем; ИИ-агент без дополнительного контекста нашёл 1 критическую, 5 высоких и 14 средних; ИИ-агент с доступом к 10 профессиональным книгам по безопасности выявил 8 критических, 9 высоких и 10 средних проблем.

OpenClawRadar
Функция использования компьютера от Anthropic вызывает блокировку управления в реальном тесте.
Безопасность

Функция использования компьютера от Anthropic вызывает блокировку управления в реальном тесте.

Anthropic внедрила возможности использования компьютера, и во время реализации механизмов управления сработал порог риска, который привёл к режиму БЛОКИРОВКИ, заблокировав все операции изменения, включая работу самого оператора по управлению.

OpenClawRadar
pi-governance: управление доступом на основе ролей (RBAC), защита от утечек данных (DLP) и аудит журналов для кодирующих агентов OpenClaw
Безопасность

pi-governance: управление доступом на основе ролей (RBAC), защита от утечек данных (DLP) и аудит журналов для кодирующих агентов OpenClaw

pi-governance — это плагин, который располагается между ИИ-агентами для программирования и вашей системой, классифицируя вызовы инструментов и блокируя рискованные операции. Он обеспечивает блокировку bash-команд, сканирование DLP на наличие секретов и PII, управление доступом на основе ролей и структурированное аудит-логирование без необходимости настройки.

OpenClawRadar