Script e Fluxo de Trabalho de Fusão de Modelos GGUF para Variantes do Qwen3.5-35B

Um usuário do Reddit compartilhou um script Python e fluxo de trabalho para mesclar arquivos de modelo GGUF com perda mínima, especificamente direcionado a variantes do Qwen3.5-35B. A abordagem combina dois modelos existentes: Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive do HauhauCS e Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF do samuelcardillo.
Detalhes Técnicos
O modelo mesclado está disponível como uma versão quantizada Q4_0 em Hugging Face. De acordo com a fonte, o ajuste fino do samuelcardillo supera a versão do Jackrong para o Qwen 3.5 35B.
Fluxo de Trabalho de Mesclagem
O script Python (disponível no Pastebin) foi "vibecoded via Claude Opus 4.6" e oferece suporte a:
- Mesclagem de arquivos GGUF no Google Colab Free Tier
- Quantização via llama-quantize
- Quantização Q4_K_M para modelos 35B
- Quantização Q8 para modelos 8B
O autor observa que não pode criar versões quantizadas Q8_0 ou F16 devido a limitações de espaço em disco no Google Colab Free tier, mas sugere que outros possam ajustar o script via Claude Opus para essas quantizações.
Configurações Ótimas
Para melhor desempenho no LM Studio, use estes parâmetros:
Temperatura: 0.7
Amostragem Top K: 20
Penalidade de Presença: 1.5
Amostragem Top P: 0.8
Amostragem Min P: 0
Seed: 3407 ou 42
O prompt do sistema (versão completa no Pastebin) deve incluir esta primeira linha: "Você é Qwen, criado pela Alibaba Cloud. Você é um assistente útil." O autor observa que o modelo tem desempenho inferior sem esta linha.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

A ferramenta Depct coleta dados de tempo de execução para ajudar o Claude a depurar problemas de produção.
Depct é uma ferramenta que coleta instrumentação de tempo de execução de aplicativos Node.js, constrói gráficos a partir dos dados e os envia para o Claude via AWS Bedrock para ajudar a depurar falhas intermitentes em produção. Também gera diagramas de arquitetura e mapas de dependência a partir do comportamento em tempo de execução.

Comparação de Quatro Provedores de Hospedagem Gerenciada OpenClaw para 2026
Um desenvolvedor testou quatro provedores de hospedagem gerenciada do OpenClaw ao longo de dois meses, classificando-os com base no tempo de configuração, tempo de atividade, confiabilidade de integração, roteamento de modelos, custo e capacidade de lidar com tarefas de múltiplas etapas. O LobsterTank custa US$ 2/mês com hospedagem básica de contêineres, o KiwiClaw é US$ 39/mês com melhor suporte, o xCloud é US$ 24/mês com tempo de atividade sólido e o RunLobster é US$ 49/mês com integração extensiva de ferramentas e preço fixo.

Architect CLI: Ferramenta de código aberto para orquestrar agentes de IA headless em CI/CD
Architect é uma ferramenta CLI de código aberto projetada para agentes de IA autônomos em pipelines de CI/CD, apresentando o Ralph Loop para ciclos de teste e repetição, guardrails determinísticos, definições de pipeline em YAML e suporte para múltiplos LLMs via LiteLLM.

Merlin: Deduplicação de contexto LLM local-first – meça até 71% de sobreposição de chunks, gratuito e open-core
Merlin é uma ferramenta de deduplicação de contexto local-first que mediu 22-71% de sobreposição de chunks em 22 milhões de passagens de sessões reais de agente/RAG. Funciona como proxy HTTP (Ollama/vLLM/SGLang/llama.cpp), servidor MCP (Claude/Cursor/OpenClaw) ou CLI standalone. Open-core MIT com limites de uso diário.