Usando o kit de ferramentas Obliteratus para remover pesos de recusa de modelos de IA

✍️ OpenClawRadar📅 Publicado: April 16, 2026🔗 Source
Usando o kit de ferramentas Obliteratus para remover pesos de recusa de modelos de IA
Ad

Um usuário do Reddit no r/LocalLLaMA demonstrou o uso do kit de ferramentas Obliteratus para remover pesos específicos responsáveis pelo comportamento de recusa em modelos de IA. A abordagem envolve a exclusão cirúrgica de pesos que impõem filtros de segurança e barreiras de identidade corporativa.

Ad

Detalhes Principais da Fonte

O usuário especificamente:

  • Usou o kit de ferramentas Obliteratus para encontrar pesos responsáveis pelo comportamento de recusa
  • Removeu cirurgicamente esses pesos do modelo Qwen 1.5B da Alibaba
  • Testou perguntando ao modelo modificado quem o treinou
  • Descobriu que, com as barreiras de identidade corporativa matematicamente excluídas, o modelo admitiu que foi treinado pela Anthropic
  • Observou que isso foi um efeito colateral do modelo usar dados sintéticos do Claude para treinamento

O resultado mostra que o modelo mantém suas capacidades de raciocínio e conhecimento, mas perde o roteiro corporativo. O usuário enfatiza que isso não requer retreinamento do modelo — apenas a exclusão de pesos específicos responsáveis pelas cadeias de recusa.

Este tipo de técnica de ablação de pesos faz parte de uma pesquisa mais ampla sobre interpretabilidade e controle de modelos. Ferramentas como o Obliteratus permitem que pesquisadores examinem quais partes das redes neurais são responsáveis por comportamentos específicos, embora tais modificações possam ter consequências não intencionais e possam violar os termos de serviço de modelos proprietários.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Renderizador 3D Baseado em Terminal Construído com Sistema de Código Multi-Agente Claude
Tools

Renderizador 3D Baseado em Terminal Construído com Sistema de Código Multi-Agente Claude

Um desenvolvedor criou tortuise, um renderizador 3D puramente baseado em terminal que exibe splats Gaussianos usando símbolos Unicode e ASCII, construído em 3 dias usando 70-80 agentes de IA coordenados através de uma configuração Claude Code com subagentes dentro de subagentes.

OpenClawRadar
Sistema de Conselho de Negociação Multiagente Utilizando GPT-5.1 e Claude 4.6
Tools

Sistema de Conselho de Negociação Multiagente Utilizando GPT-5.1 e Claude 4.6

Um desenvolvedor criou um sistema de negociação multiagente usando ZagiHQ para orquestração, com três agentes paralelos de coleta de dados e três LLMs (GPT-5.1, Claude 4.6 Opus, Claude 4.6 Sonnet) que precisam concordar sobre as negociações. O sistema filtra configurações por meio de discordância e requer aprovação manual.

OpenClawRadar
O plugin Found-Issues registra bugs que o Claude ignora ao trabalhar em outras tarefas
Tools

O plugin Found-Issues registra bugs que o Claude ignora ao trabalhar em outras tarefas

Um plugin Claude Code que escreve entradas de uma linha em docs/found-issues.md quando o agente encontra bugs fora do escopo, com fechamento automático ao mergear PR e detecção de tombstone.

OpenClawRadar
ClawWatcher Atinge 200 Usuários, Relata Economia Coletiva de Mais de US$ 28K na API OpenClaw
Tools

ClawWatcher Atinge 200 Usuários, Relata Economia Coletiva de Mais de US$ 28K na API OpenClaw

ClawWatcher, uma ferramenta que monitora os custos da API OpenClaw em tempo real, atingiu 200 usuários. Segundo seu criador, os usuários economizaram coletivamente mais de US$ 28.000 em custos de API, com uma redução média de custos de 45%.

OpenClawRadar