Использование инструментария Obliteratus для удаления весов отказа из моделей искусственного интеллекта.

Пользователь Reddit на r/LocalLLaMA продемонстрировал использование инструментария Obliteratus для удаления конкретных весов, отвечающих за поведение отказа в моделях ИИ. Этот подход включает хирургическое удаление весов, которые обеспечивают работу фильтров безопасности и корпоративных ограничений идентичности.
Ключевые детали из источника
Пользователь конкретно:
- Использовал инструментарий Obliteratus для поиска весов, отвечающих за поведение отказа
- Хирургически удалил эти веса из модели Qwen 1.5B от Alibaba
- Протестировал, спросив модифицированную модель, кто её обучал
- Обнаружил, что с математически удалёнными корпоративными ограничениями идентичности модель признала, что её обучала Anthropic
- Отметил, что это был побочный эффект использования синтетических данных Claude для обучения модели
Результат показывает, что модель сохраняет свои способности к рассуждению и знаниям, но теряет корпоративные скрипты. Пользователь подчёркивает, что это не требует переобучения модели — только удаления конкретных весов, отвечающих за цепочки отказа.
Такой метод абляции весов является частью более широких исследований интерпретируемости и контроля моделей. Инструменты вроде Obliteratus позволяют исследователям изучать, какие части нейронных сетей отвечают за конкретное поведение, хотя такие модификации могут иметь непредвиденные последствия и могут нарушать условия использования проприетарных моделей.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Создание автономного исследовательского агента с помощью C# и локальных LLM.
A C# research agent automates URL processing with local LLMs using Ollama and llama3.1:8b, generating structured markdown reports from web searches.

Счетчик токенов Claude обновлен функцией сравнения моделей
Инструмент Simon Willison для подсчёта токенов Claude теперь поддерживает сравнение количества токенов между разными моделями Claude. Обновление показывает, что Opus 4.7 использует в 1.0–1.35 раз больше токенов, чем Opus 4.6, из-за обновлённого токенизатора, что потенциально увеличивает затраты примерно на 40%, несмотря на идентичные цены.

Холабосс AI Runtime переходит на TypeScript, реализует постоянные порты MCP.
Среда выполнения локального агента Holaboss AI была переработана для использования исключительно TypeScript, что устранило зависимости от Python и уменьшило размер пакета. Теперь она сохраняет порты серверов MCP в SQLite с ограничениями UNIQUE(port), чтобы предотвратить конфликты при перезапусках.

Представляем Aionic Anthology: Фреймворк для структурирования задач ИИ Клода.
Фреймворк Aionic Anthology организует задачи ИИ Клода, разделяя контекст на категории и добавляя систему оценки рисков для улучшения выполнения задач.