Использование инструментария Obliteratus для удаления весов отказа из моделей искусственного интеллекта.

✍️ OpenClawRadar📅 Опубликовано: 16 апреля 2026 г.🔗 Source
Использование инструментария Obliteratus для удаления весов отказа из моделей искусственного интеллекта.
Ad

Пользователь Reddit на r/LocalLLaMA продемонстрировал использование инструментария Obliteratus для удаления конкретных весов, отвечающих за поведение отказа в моделях ИИ. Этот подход включает хирургическое удаление весов, которые обеспечивают работу фильтров безопасности и корпоративных ограничений идентичности.

Ad

Ключевые детали из источника

Пользователь конкретно:

  • Использовал инструментарий Obliteratus для поиска весов, отвечающих за поведение отказа
  • Хирургически удалил эти веса из модели Qwen 1.5B от Alibaba
  • Протестировал, спросив модифицированную модель, кто её обучал
  • Обнаружил, что с математически удалёнными корпоративными ограничениями идентичности модель признала, что её обучала Anthropic
  • Отметил, что это был побочный эффект использования синтетических данных Claude для обучения модели

Результат показывает, что модель сохраняет свои способности к рассуждению и знаниям, но теряет корпоративные скрипты. Пользователь подчёркивает, что это не требует переобучения модели — только удаления конкретных весов, отвечающих за цепочки отказа.

Такой метод абляции весов является частью более широких исследований интерпретируемости и контроля моделей. Инструменты вроде Obliteratus позволяют исследователям изучать, какие части нейронных сетей отвечают за конкретное поведение, хотя такие модификации могут иметь непредвиденные последствия и могут нарушать условия использования проприетарных моделей.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

🦀
Инструменты

Многопользовательская память: система общей памяти с открытым исходным кодом для ИИ-агентов

Multi-Agent Memory — это проект с открытым исходным кодом, предоставляющий систему общей памяти для ИИ-агентов на разных машинах, инструментах и фреймворках. Он поддерживает четыре типа памяти с определённым поведением и включает такие функции, как очистка учётных данных, изоляция агентов и консолидация LLM.

OpenClawRadar
Ежемесячный план Alibaba стоимостью $10 предоставляет пользователям OpenClaw расширенный доступ к множеству ИИ-моделей.
Инструменты

Ежемесячный план Alibaba стоимостью $10 предоставляет пользователям OpenClaw расширенный доступ к множеству ИИ-моделей.

За 10 долларов в месяц план от Alibaba предоставляет доступ к моделям Qwen3.5-Plus, Kimi-K2.5, GLM-5 и MiniMax-M2.5 с квотами в 1200 запросов за 5 часов, 9000 в неделю и 18 000 в месяц.

OpenClawRadar
Плагин Claude-ETA добавляет тайминг задач и обнаружение циклов исправлений в Claude Code.
Инструменты

Плагин Claude-ETA добавляет тайминг задач и обнаружение циклов исправлений в Claude Code.

Claude-ETA — это плагин для Claude Code, который отслеживает время выполнения задач, изучает вашу реальную скорость работы и передает актуальные данные обратно в Claude перед ответом. Он также обнаруживает циклы исправления ошибок, анализируя их содержание, и вмешивается после трех одинаковых неудач.

OpenClawRadar
IUM: Индексатор символов MCP сокращает использование токенов AI Agent в 15,9 раза по сравнению с grep
Инструменты

IUM: Индексатор символов MCP сокращает использование токенов AI Agent в 15,9 раза по сравнению с grep

IUM индексирует кодовые базы в матрицу SQLite событий символов, предоставляя точные координаты файл:строка, трассировку графа вызовов и семантический поиск через MCP. Протестирован на DataFusion (1 538 файлов), показав в 15,9 раз меньше токенов, чем grep для эквивалентных запросов.

OpenClawRadar