Использование инструментария Obliteratus для удаления весов отказа из моделей искусственного интеллекта.

Пользователь Reddit на r/LocalLLaMA продемонстрировал использование инструментария Obliteratus для удаления конкретных весов, отвечающих за поведение отказа в моделях ИИ. Этот подход включает хирургическое удаление весов, которые обеспечивают работу фильтров безопасности и корпоративных ограничений идентичности.
Ключевые детали из источника
Пользователь конкретно:
- Использовал инструментарий Obliteratus для поиска весов, отвечающих за поведение отказа
- Хирургически удалил эти веса из модели Qwen 1.5B от Alibaba
- Протестировал, спросив модифицированную модель, кто её обучал
- Обнаружил, что с математически удалёнными корпоративными ограничениями идентичности модель признала, что её обучала Anthropic
- Отметил, что это был побочный эффект использования синтетических данных Claude для обучения модели
Результат показывает, что модель сохраняет свои способности к рассуждению и знаниям, но теряет корпоративные скрипты. Пользователь подчёркивает, что это не требует переобучения модели — только удаления конкретных весов, отвечающих за цепочки отказа.
Такой метод абляции весов является частью более широких исследований интерпретируемости и контроля моделей. Инструменты вроде Obliteratus позволяют исследователям изучать, какие части нейронных сетей отвечают за конкретное поведение, хотя такие модификации могут иметь непредвиденные последствия и могут нарушать условия использования проприетарных моделей.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также
Многопользовательская память: система общей памяти с открытым исходным кодом для ИИ-агентов
Multi-Agent Memory — это проект с открытым исходным кодом, предоставляющий систему общей памяти для ИИ-агентов на разных машинах, инструментах и фреймворках. Он поддерживает четыре типа памяти с определённым поведением и включает такие функции, как очистка учётных данных, изоляция агентов и консолидация LLM.

Ежемесячный план Alibaba стоимостью $10 предоставляет пользователям OpenClaw расширенный доступ к множеству ИИ-моделей.
За 10 долларов в месяц план от Alibaba предоставляет доступ к моделям Qwen3.5-Plus, Kimi-K2.5, GLM-5 и MiniMax-M2.5 с квотами в 1200 запросов за 5 часов, 9000 в неделю и 18 000 в месяц.

Плагин Claude-ETA добавляет тайминг задач и обнаружение циклов исправлений в Claude Code.
Claude-ETA — это плагин для Claude Code, который отслеживает время выполнения задач, изучает вашу реальную скорость работы и передает актуальные данные обратно в Claude перед ответом. Он также обнаруживает циклы исправления ошибок, анализируя их содержание, и вмешивается после трех одинаковых неудач.

IUM: Индексатор символов MCP сокращает использование токенов AI Agent в 15,9 раза по сравнению с grep
IUM индексирует кодовые базы в матрицу SQLite событий символов, предоставляя точные координаты файл:строка, трассировку графа вызовов и семантический поиск через MCP. Протестирован на DataFusion (1 538 файлов), показав в 15,9 раз меньше токенов, чем grep для эквивалентных запросов.