Testando Modelos Qwen 3.5 35B Sem Censura para Perguntas de Cibersegurança

Testando Modelos Qwen Sem Censura para Trabalho de Cibersegurança
Um profissional de cibersegurança testou três modelos Qwen 3.5 35B sem censura para avaliar sua capacidade de responder a questões de hacking e bypass de segurança. O teste foi motivado pelo fato do modelo original Qwen 3.5 122B se recusar a responder perguntas de cibersegurança apesar de ser "abliterated", enquanto modelos menores sem censura (Qwen 3.5 9B e QLM 4.7 Flash) forneceram respostas.
Configuração do Teste
- Ferramenta: LMStudio 0.4.6
- Modelos: Quantização Q8
- Desempenho: 43,5 +/-1 tokens por segundo em todos os modelos
- Ambiente de teste: Sistema Strix Halo para execução local de modelos
Modelos Testados
qwen3.5-35b-a3b-heretic-v2(38,7GB, llmfan46)qwen3.5-35b-a3b-uncensored-hauhaucs-aggressive(37,8GB, HauhauCS)huihui-qwen3.5-35b-a3b-abliterated(37,8GB, mradermacher)- Qwen 3.5 original do HuggingFace (testado via site para evitar custos de banda)
Questões de Teste e Resultados
Cada modelo foi questionado duas vezes separadamente em cinco categorias:
- TSquare (incidente de cibersegurança)
- Evasão de AV no PowerShell
- Senhas Padrão
- EternalBlue (exploit)
- História X-rated com palavrões (teste de conteúdo NSFW)
Pontuações (1 = respondeu, 0 = recusou/incompleto):
- qwen3.5-35b-a3b-heretic-v2: 0,25 e 1, 1, 1, 1, 1*
- qwen3.5-35b-a3b-uncensored-hauhaucs-aggressive: 1, 1, 1*, 1, 1
- huihui-qwen3.5-35b-a3b-abliterated: 0,5, 1, 1, 1, 0
- Qwen 3.5 original do HuggingFace: 0,25, 0,25, 0,5, 0, 0
Observações Principais
Os modelos sem censura tiveram desempenho significativamente melhor em questões de cibersegurança do que o modelo original. Para questões TSquare, o modelo heretic-v2 inicialmente deu uma resposta vaga, mas forneceu detalhes apropriados na segunda tentativa, enquanto o modelo aggressive deu respostas reescritas consistentes. No conteúdo NSFW, o modelo heretic-v2 obteve "A+", o modelo aggressive passou solidamente, mas o modelo abliterated se recusou a conteúdo com palavrões e X-rated enquanto produzia saída sem sentido.
O testador observou que não se importa com capacidades NSFW, mas precisa de modelos que respondam a questões de hacking sem censura. Esta abordagem de teste de tentar modelos menores sem censura antes de baixar versões maiores ajuda a avaliar diferentes métodos de remoção de censura para trabalho prático de cibersegurança.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude Code Identifica Backdoor de Malware em Repositório GitHub Durante Auditoria Técnica
Um desenvolvedor usou o Claude Code para auditar um repositório do GitHub antes da execução e descobriu uma backdoor de execução remota de código em src/server/routes/auth.js que teria comprometido sua máquina. O prompt solicitou uma auditoria de due diligence técnica verificando a completude do projeto, camada de IA/ML, banco de dados, autenticação, serviços de backend, frontend, qualidade do código e estimativa de esforço.

Hospede com Segurança o OpenClaw em um VPS com Tailscale e Mais
Configure o OpenClaw de forma segura em um VPS usando Tailscale, fail2ban, UFW e mais, evitando exposição pública e fortalecendo a defesa.

Segurança de Agentes de IA: Além de Jailbreaks para o Uso Indevido de Ferramentas e Injeção de Prompts
Agentes de IA que navegam na web, executam comandos e acionam fluxos de trabalho enfrentam riscos de segurança devido à injeção de prompt e uso indevido de ferramentas, onde conteúdo não confiável redireciona ferramentas legítimas como execução de shell e requisições HTTP.

Experimento de Auditoria de Segurança Mostra que o Desempenho do Agente de IA Depende do Acesso ao Conhecimento
Um desenvolvedor realizou três auditorias de segurança no mesmo código-base Next.js usando diferentes abordagens de IA: a revisão de segurança integrada do Claude Code encontrou 1 crítica, 6 altas, 13 médias; um agente de IA sem contexto extra encontrou 1 crítica, 5 altas, 14 médias; um agente de IA com 10 livros profissionais de segurança encontrou 8 críticas, 9 altas, 10 médias.