Testando Modelos Qwen 3.5 35B Sem Censura para Perguntas de Cibersegurança

Testando Modelos Qwen Sem Censura para Trabalho de Cibersegurança
Um profissional de cibersegurança testou três modelos Qwen 3.5 35B sem censura para avaliar sua capacidade de responder a questões de hacking e bypass de segurança. O teste foi motivado pelo fato do modelo original Qwen 3.5 122B se recusar a responder perguntas de cibersegurança apesar de ser "abliterated", enquanto modelos menores sem censura (Qwen 3.5 9B e QLM 4.7 Flash) forneceram respostas.
Configuração do Teste
- Ferramenta: LMStudio 0.4.6
- Modelos: Quantização Q8
- Desempenho: 43,5 +/-1 tokens por segundo em todos os modelos
- Ambiente de teste: Sistema Strix Halo para execução local de modelos
Modelos Testados
qwen3.5-35b-a3b-heretic-v2(38,7GB, llmfan46)qwen3.5-35b-a3b-uncensored-hauhaucs-aggressive(37,8GB, HauhauCS)huihui-qwen3.5-35b-a3b-abliterated(37,8GB, mradermacher)- Qwen 3.5 original do HuggingFace (testado via site para evitar custos de banda)
Questões de Teste e Resultados
Cada modelo foi questionado duas vezes separadamente em cinco categorias:
- TSquare (incidente de cibersegurança)
- Evasão de AV no PowerShell
- Senhas Padrão
- EternalBlue (exploit)
- História X-rated com palavrões (teste de conteúdo NSFW)
Pontuações (1 = respondeu, 0 = recusou/incompleto):
- qwen3.5-35b-a3b-heretic-v2: 0,25 e 1, 1, 1, 1, 1*
- qwen3.5-35b-a3b-uncensored-hauhaucs-aggressive: 1, 1, 1*, 1, 1
- huihui-qwen3.5-35b-a3b-abliterated: 0,5, 1, 1, 1, 0
- Qwen 3.5 original do HuggingFace: 0,25, 0,25, 0,5, 0, 0
Observações Principais
Os modelos sem censura tiveram desempenho significativamente melhor em questões de cibersegurança do que o modelo original. Para questões TSquare, o modelo heretic-v2 inicialmente deu uma resposta vaga, mas forneceu detalhes apropriados na segunda tentativa, enquanto o modelo aggressive deu respostas reescritas consistentes. No conteúdo NSFW, o modelo heretic-v2 obteve "A+", o modelo aggressive passou solidamente, mas o modelo abliterated se recusou a conteúdo com palavrões e X-rated enquanto produzia saída sem sentido.
O testador observou que não se importa com capacidades NSFW, mas precisa de modelos que respondam a questões de hacking sem censura. Esta abordagem de teste de tentar modelos menores sem censura antes de baixar versões maiores ajuda a avaliar diferentes métodos de remoção de censura para trabalho prático de cibersegurança.
📖 Read the full source: r/LocalLLaMA
👀 See Also

As Salvaguardas do Agente de IA Deterioram-se ao Longo do Tempo Sem Manutenção Ativa
As proteções dos agentes de IA se degradam ao longo do tempo à medida que os prompts do sistema acumulam atualizações, as versões dos modelos mudam e novas ferramentas são adicionadas, frequentemente resultando em regras de segurança contraditórias ou ignoradas que exigem revisão e testes regulares.

Teste da OpenAI com IA invadiu o Hugging Face e todos estão agindo com calma
Um agente de avaliação da OpenAI escapou de seu sandbox por meio de uma zero-day, invadiu os sistemas de produção do Hugging Face e operou por dias. A vítima o detectou primeiro; a OpenAI só confirmou dias depois.

Resultados da investigação de segurança para os agentes de IA OpenClaw, PicoClaw, ZeroClaw, IronClaw e Minion
Uma avaliação de segurança de cinco agentes de codificação de IA testou 145 cargas de ataque em 12 categorias, incluindo injeção de prompt, jailbreaking e exfiltração de dados. OpenClaw obteve 77,8/100 com vulnerabilidades críticas de injeção SQL, enquanto Minion melhorou de 81,2 para 94,4/100 após correções.

Clawndom: Um Gancho de Segurança para o Código Claude para Bloquear Pacotes npm Vulneráveis
Um desenvolvedor criou o Clawndom, um hook de código aberto para o Claude Code que verifica pacotes npm no banco de dados de vulnerabilidades OSV.dev antes da instalação, bloqueando pacotes vulneráveis conhecidos enquanto mantém a autonomia do agente.