Usando o kit de ferramentas Obliteratus para remover pesos de recusa de modelos de IA

Um usuário do Reddit no r/LocalLLaMA demonstrou o uso do kit de ferramentas Obliteratus para remover pesos específicos responsáveis pelo comportamento de recusa em modelos de IA. A abordagem envolve a exclusão cirúrgica de pesos que impõem filtros de segurança e barreiras de identidade corporativa.
Detalhes Principais da Fonte
O usuário especificamente:
- Usou o kit de ferramentas Obliteratus para encontrar pesos responsáveis pelo comportamento de recusa
- Removeu cirurgicamente esses pesos do modelo Qwen 1.5B da Alibaba
- Testou perguntando ao modelo modificado quem o treinou
- Descobriu que, com as barreiras de identidade corporativa matematicamente excluídas, o modelo admitiu que foi treinado pela Anthropic
- Observou que isso foi um efeito colateral do modelo usar dados sintéticos do Claude para treinamento
O resultado mostra que o modelo mantém suas capacidades de raciocínio e conhecimento, mas perde o roteiro corporativo. O usuário enfatiza que isso não requer retreinamento do modelo — apenas a exclusão de pesos específicos responsáveis pelas cadeias de recusa.
Este tipo de técnica de ablação de pesos faz parte de uma pesquisa mais ampla sobre interpretabilidade e controle de modelos. Ferramentas como o Obliteratus permitem que pesquisadores examinem quais partes das redes neurais são responsáveis por comportamentos específicos, embora tais modificações possam ter consequências não intencionais e possam violar os termos de serviço de modelos proprietários.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Argus: Uma Extensão do VS Code para Depurar Custos e Comportamento de Sessão do Claude Code
Um desenvolvedor criou o Argus, uma extensão do VS Code que analisa transcrições JSONL do Claude Code e as exibe em uma linha do tempo em tempo real, com detalhamento de tokens/custo por etapa, taxa de acerto de cache e sinalização de loops de repetição, leituras duplicadas e pressão de contexto.

Claude Code v2.1.59 adiciona memória automática, comando de cópia e melhorias no shell.
Claude Code v2.1.59 introduz o salvamento automático de contexto para a memória automática com gerenciamento /memory, adiciona um comando /copy para seleção interativa de blocos de código e melhora as sugestões de prefixo para comandos bash compostos.

Skir: Uma Alternativa Moderna aos Protocol Buffers para Troca de Dados com Segurança de Tipos
Skir é uma linguagem declarativa para definir tipos de dados, constantes e APIs que gera código idiomático e type-safe em TypeScript, Python, Java, C++, Kotlin e Dart a partir de um único arquivo .skir. Inclui segurança integrada para evolução de esquema, suporte a RPC similar ao gRPC e serialização para formatos JSON ou binários.

Traduzir para pt: Atualizações do Prompt do Sistema Claude Code v2.1.76: Refinamentos do Monitor de Segurança e Novo Evento de Hook
Claude Code v2.1.76 inclui atualizações nos prompts do sistema com 43 novos tokens, apresentando refinamentos no monitor de segurança para agentes autônomos e a adição de um evento de hook PostCompact. As mudanças incluem detecção de dados sensíveis esclarecida, exemplos expandidos de desserialização de código e formatação aprimorada para orientações sobre destruição local irreversível.