Usando o kit de ferramentas Obliteratus para remover pesos de recusa de modelos de IA

Um usuário do Reddit no r/LocalLLaMA demonstrou o uso do kit de ferramentas Obliteratus para remover pesos específicos responsáveis pelo comportamento de recusa em modelos de IA. A abordagem envolve a exclusão cirúrgica de pesos que impõem filtros de segurança e barreiras de identidade corporativa.
Detalhes Principais da Fonte
O usuário especificamente:
- Usou o kit de ferramentas Obliteratus para encontrar pesos responsáveis pelo comportamento de recusa
- Removeu cirurgicamente esses pesos do modelo Qwen 1.5B da Alibaba
- Testou perguntando ao modelo modificado quem o treinou
- Descobriu que, com as barreiras de identidade corporativa matematicamente excluídas, o modelo admitiu que foi treinado pela Anthropic
- Observou que isso foi um efeito colateral do modelo usar dados sintéticos do Claude para treinamento
O resultado mostra que o modelo mantém suas capacidades de raciocínio e conhecimento, mas perde o roteiro corporativo. O usuário enfatiza que isso não requer retreinamento do modelo — apenas a exclusão de pesos específicos responsáveis pelas cadeias de recusa.
Este tipo de técnica de ablação de pesos faz parte de uma pesquisa mais ampla sobre interpretabilidade e controle de modelos. Ferramentas como o Obliteratus permitem que pesquisadores examinem quais partes das redes neurais são responsáveis por comportamentos específicos, embora tais modificações possam ter consequências não intencionais e possam violar os termos de serviço de modelos proprietários.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Renderizador 3D Baseado em Terminal Construído com Sistema de Código Multi-Agente Claude
Um desenvolvedor criou tortuise, um renderizador 3D puramente baseado em terminal que exibe splats Gaussianos usando símbolos Unicode e ASCII, construído em 3 dias usando 70-80 agentes de IA coordenados através de uma configuração Claude Code com subagentes dentro de subagentes.

Sistema de Conselho de Negociação Multiagente Utilizando GPT-5.1 e Claude 4.6
Um desenvolvedor criou um sistema de negociação multiagente usando ZagiHQ para orquestração, com três agentes paralelos de coleta de dados e três LLMs (GPT-5.1, Claude 4.6 Opus, Claude 4.6 Sonnet) que precisam concordar sobre as negociações. O sistema filtra configurações por meio de discordância e requer aprovação manual.

O plugin Found-Issues registra bugs que o Claude ignora ao trabalhar em outras tarefas
Um plugin Claude Code que escreve entradas de uma linha em docs/found-issues.md quando o agente encontra bugs fora do escopo, com fechamento automático ao mergear PR e detecção de tombstone.

ClawWatcher Atinge 200 Usuários, Relata Economia Coletiva de Mais de US$ 28K na API OpenClaw
ClawWatcher, uma ferramenta que monitora os custos da API OpenClaw em tempo real, atingiu 200 usuários. Segundo seu criador, os usuários economizaram coletivamente mais de US$ 28.000 em custos de API, com uma redução média de custos de 45%.