Usando o kit de ferramentas Obliteratus para remover pesos de recusa de modelos de IA

✍️ OpenClawRadar📅 Publicado: April 16, 2026🔗 Source
Usando o kit de ferramentas Obliteratus para remover pesos de recusa de modelos de IA
Ad

Um usuário do Reddit no r/LocalLLaMA demonstrou o uso do kit de ferramentas Obliteratus para remover pesos específicos responsáveis pelo comportamento de recusa em modelos de IA. A abordagem envolve a exclusão cirúrgica de pesos que impõem filtros de segurança e barreiras de identidade corporativa.

Ad

Detalhes Principais da Fonte

O usuário especificamente:

  • Usou o kit de ferramentas Obliteratus para encontrar pesos responsáveis pelo comportamento de recusa
  • Removeu cirurgicamente esses pesos do modelo Qwen 1.5B da Alibaba
  • Testou perguntando ao modelo modificado quem o treinou
  • Descobriu que, com as barreiras de identidade corporativa matematicamente excluídas, o modelo admitiu que foi treinado pela Anthropic
  • Observou que isso foi um efeito colateral do modelo usar dados sintéticos do Claude para treinamento

O resultado mostra que o modelo mantém suas capacidades de raciocínio e conhecimento, mas perde o roteiro corporativo. O usuário enfatiza que isso não requer retreinamento do modelo — apenas a exclusão de pesos específicos responsáveis pelas cadeias de recusa.

Este tipo de técnica de ablação de pesos faz parte de uma pesquisa mais ampla sobre interpretabilidade e controle de modelos. Ferramentas como o Obliteratus permitem que pesquisadores examinem quais partes das redes neurais são responsáveis por comportamentos específicos, embora tais modificações possam ter consequências não intencionais e possam violar os termos de serviço de modelos proprietários.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Argus: Uma Extensão do VS Code para Depurar Custos e Comportamento de Sessão do Claude Code
Tools

Argus: Uma Extensão do VS Code para Depurar Custos e Comportamento de Sessão do Claude Code

Um desenvolvedor criou o Argus, uma extensão do VS Code que analisa transcrições JSONL do Claude Code e as exibe em uma linha do tempo em tempo real, com detalhamento de tokens/custo por etapa, taxa de acerto de cache e sinalização de loops de repetição, leituras duplicadas e pressão de contexto.

OpenClawRadar
Claude Code v2.1.59 adiciona memória automática, comando de cópia e melhorias no shell.
Tools

Claude Code v2.1.59 adiciona memória automática, comando de cópia e melhorias no shell.

Claude Code v2.1.59 introduz o salvamento automático de contexto para a memória automática com gerenciamento /memory, adiciona um comando /copy para seleção interativa de blocos de código e melhora as sugestões de prefixo para comandos bash compostos.

OpenClawRadar
Skir: Uma Alternativa Moderna aos Protocol Buffers para Troca de Dados com Segurança de Tipos
Tools

Skir: Uma Alternativa Moderna aos Protocol Buffers para Troca de Dados com Segurança de Tipos

Skir é uma linguagem declarativa para definir tipos de dados, constantes e APIs que gera código idiomático e type-safe em TypeScript, Python, Java, C++, Kotlin e Dart a partir de um único arquivo .skir. Inclui segurança integrada para evolução de esquema, suporte a RPC similar ao gRPC e serialização para formatos JSON ou binários.

OpenClawRadar
Traduzir para pt: Atualizações do Prompt do Sistema Claude Code v2.1.76: Refinamentos do Monitor de Segurança e Novo Evento de Hook
Tools

Traduzir para pt: Atualizações do Prompt do Sistema Claude Code v2.1.76: Refinamentos do Monitor de Segurança e Novo Evento de Hook

Claude Code v2.1.76 inclui atualizações nos prompts do sistema com 43 novos tokens, apresentando refinamentos no monitor de segurança para agentes autônomos e a adição de um evento de hook PostCompact. As mudanças incluem detecção de dados sensíveis esclarecida, exemplos expandidos de desserialização de código e formatação aprimorada para orientações sobre destruição local irreversível.

OpenClawRadar