Script y Flujo de Trabajo para Fusión de Modelos GGUF de Variantes Qwen3.5-35B

Un usuario de Reddit ha compartido un script de Python y un flujo de trabajo para fusionar archivos de modelo GGUF con pérdida mínima, específicamente dirigido a variantes de Qwen3.5-35B. El enfoque combina dos modelos existentes: Qwen3.5-35B-A3B-Uncensored-HauhauCS-Aggressive de HauhauCS y Qwen3.5-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF de samuelcardillo.
Detalles Técnicos
El modelo fusionado está disponible como versión cuantizada Q4_0 en Hugging Face. Según la fuente, el ajuste fino de samuelcardillo supera a la versión de Jackrong para Qwen 3.5 35B.
Flujo de Trabajo de Fusión
El script de Python (disponible en Pastebin) fue "vibecoded via Claude Opus 4.6" y soporta:
- Fusión de archivos GGUF en Google Colab Free Tier
- Cuantización mediante llama-quantize
- Cuantización Q4_K_M para modelos 35B
- Cuantización Q8 para modelos 8B
El autor señala que no puede crear versiones cuantizadas Q8_0 o F16 debido a limitaciones de espacio en disco en Google Colab Free tier, pero sugiere que otros pueden modificar el script mediante Claude Opus para esas cuantizaciones.
Configuraciones Óptimas
Para el mejor rendimiento en LM Studio, use estos parámetros:
Temperatura: 0.7
Muestreo Top K: 20
Penalización de Presencia: 1.5
Muestreo Top P: 0.8
Muestreo Min P: 0
Semilla: 3407 o 42
El prompt del sistema (versión completa en Pastebin) debe incluir esta primera línea: "Eres Qwen, creado por Alibaba Cloud. Eres un asistente útil." El autor señala que el modelo tiene un rendimiento inferior sin esta línea.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Construyendo un Lenguaje de Programación con Claude Code: El Experimento Cutlet
Ankur Sethi construyó un lenguaje de programación completo llamado Cutlet usando Claude Code durante cuatro semanas, con la IA generando cada línea de código mientras él se enfocaba en barreras de seguridad y pruebas. El lenguaje cuenta con tipado dinámico, operaciones vectorizadas y un REPL, ejecutándose en macOS y Linux.

depct: El servidor MCP proporciona a Claude análisis en tiempo de ejecución y documentación en vivo.
depct es un servidor MCP que instrumenta aplicaciones Node.js para capturar datos en tiempo de ejecución, generando documentación estructurada con niveles de confianza que Claude puede consultar antes de programar. La herramienta actualiza la documentación automáticamente después de que Claude realiza cambios.

Sistema de 7 Agentes en Claude Code Reemplaza las Ceremonias de Sprint para Desarrolladores Solitarios
Un desarrollador que pasó años como PM descubrió que trabajar solo con Claude Code carecía de la disciplina de un equipo real: nadie hacía preguntas antes del código, no había compuertas sistemáticas, ni resultados de retrospectivas. Así que construyó un sistema de 7 agentes dentro de Claude Code que simula un equipo de ingeniería completo en cada PR.

Kvaser: Un orquestador de IA local-first de código abierto con enrutamiento de subagentes e integración con Wolfram
Kvaser es un proxy MCP de intermediario que orquesta subagentes con listas blancas inteligentes de herramientas, RAG sin incrustaciones a través de Kiwix e integración con Wolfram Engine para matemática simbólica. Construido con Qwen 3.6 35B y enrutamiento de subagentes a diferentes modelos/máquinas.