Script e Fluxo de Trabalho de Fusão de Modelos GGUF para Variantes do Qwen3.5-35B

Um usuário do Reddit compartilhou um script Python e fluxo de trabalho para mesclar arquivos de modelo GGUF com perda mínima, especificamente direcionado a variantes do Qwen3.5-35B. A abordagem combina dois modelos existentes: Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive do HauhauCS e Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF do samuelcardillo.
Detalhes Técnicos
O modelo mesclado está disponível como uma versão quantizada Q4_0 em Hugging Face. De acordo com a fonte, o ajuste fino do samuelcardillo supera a versão do Jackrong para o Qwen 3.5 35B.
Fluxo de Trabalho de Mesclagem
O script Python (disponível no Pastebin) foi "vibecoded via Claude Opus 4.6" e oferece suporte a:
- Mesclagem de arquivos GGUF no Google Colab Free Tier
- Quantização via llama-quantize
- Quantização Q4_K_M para modelos 35B
- Quantização Q8 para modelos 8B
O autor observa que não pode criar versões quantizadas Q8_0 ou F16 devido a limitações de espaço em disco no Google Colab Free tier, mas sugere que outros possam ajustar o script via Claude Opus para essas quantizações.
Configurações Ótimas
Para melhor desempenho no LM Studio, use estes parâmetros:
Temperatura: 0.7
Amostragem Top K: 20
Penalidade de Presença: 1.5
Amostragem Top P: 0.8
Amostragem Min P: 0
Seed: 3407 ou 42
O prompt do sistema (versão completa no Pastebin) deve incluir esta primeira linha: "Você é Qwen, criado pela Alibaba Cloud. Você é um assistente útil." O autor observa que o modelo tem desempenho inferior sem esta linha.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Apresentando cltree: Uma TUI de Árvore de Arquivos para o Claude Code
cltree é uma TUI (Interface de Usuário de Terminal) com painel dividido que exibe a árvore de arquivos do seu projeto em tempo real ao lado do Claude Code, mostrando o diretório de trabalho atual, ocultando ruídos e permitindo que todas as teclas digitadas sejam passadas diretamente.

10.33 t/s no Qwen 3.5 35B com um Laptop de $300: Análise Completa de Otimização
Um desenvolvedor alcança 10,33 t/s no Qwen 3.5 35B Q4_K_S em um Lenovo Ideapad Slim 3i ($300) usando ik_llama.cpp, core pinning, decodificação especulativa MTP e ajuste de desempenho da BIOS.

Ferramenta de código aberto para feeds do Reddit curados por IA usando Cloudflare, Supabase e Vercel
Um desenvolvedor disponibilizou como código aberto uma ferramenta auto-hospedada que filtra o Reddit em busca de postagens de qualidade sobre desenvolvimento assistido por IA, usando Cloudflare Workers para tarefas agendadas e proxies, Supabase para armazenamento e Vercel para o frontend. A ferramenta inclui pontuação de engajamento, resumos opcionais de LLM e custa US$ 1-2/mês para processamento de IA.

Kanban CLI: Um Gerenciador de Tarefas Local-Primeiro e Agente-Primeiro para o Terminal
Kanban CLI é uma ferramenta de terminal em Rust que oferece rastreamento de tarefas estruturado com integração completa ao git, projetada para fluxos de trabalho orientados por agentes de IA.