Harmonic-9B: Ajuste fino en dos etapas de Qwen3.5-9B para agentes de IA

¿Qué es Harmonic-9B?
Harmonic-9B es una versión ajustada de Qwen3.5-9B específicamente diseñada para aplicaciones de agentes de IA. El desarrollador está utilizando un enfoque de entrenamiento en dos etapas: la Etapa 1 se centra en el entrenamiento de razonamiento intensivo (ya completado), mientras que la Etapa 2 se enfoca en llamadas a herramientas ligeras y ajuste fino de agentes (aún en progreso al momento del anuncio).
Detalles Técnicos
El objetivo es combinar un razonamiento estructurado sólido con un uso de herramientas limpio y confiable, manteniendo capacidades de chat natural. Para la Etapa 2, el desarrollador ha filtrado un conjunto de datos de trazas de agentes Hermes, que ha publicado como código abierto en Hugging Face.
Mejoras clave en el conjunto de datos filtrado:
- Autocorrección: 6% → 63%
- Pasos de verificación: 26% → 96%
- Profundidad de pensamiento: +40%
- Llamadas a herramientas/JSON válidos: 100%
Ya están disponibles versiones cuantizadas GGUF para descargar, aunque el desarrollador señala que aún no ha ejecutado pruebas de referencia adecuadas porque la Etapa 2 sigue en entrenamiento. Las verificaciones iniciales en el punto de control de la Etapa 1 mostraron buenos resultados para la estructura de razonamiento.
Estado Actual y Próximos Pasos
El desarrollador está buscando comentarios sobre cómo se comporta Harmonic-9B en entornos de agentes como OpenClaw, LangGraph y ReAct. Planean compartir números de referencia una vez que finalice la Etapa 2 y puedan ejecutar evaluaciones adecuadas de agentes. Este trabajo es parte de una investigación continua sobre la curación de datos de alta señal y enfoques de ajuste fino por etapas.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Anthropic pausa cambio de crédito para Claude Code: Agent SDK sigue en suscripción
Anthropic detiene el cambio planeado de mover el SDK de Agent, claude -p y aplicaciones de terceros a un crédito mensual dedicado. El uso continúa bajo los límites de suscripción existentes.

Reseña de OpenClaw: Problemas de Fiabilidad en su Estado Actual, Valor como Herramienta de Aprendizaje
Un desarrollador con amplia experiencia en plataformas de IA informa que OpenClaw tiene dificultades con la confiabilidad en tareas básicas de múltiples pasos, lo que hace cuestionables las aplicaciones empresariales autónomas, pero encuentra valor en aprender la estructura y orquestación de agentes.

El desarrollador prefiere Qwen3.5-27B sobre los modelos propietarios por su modo de fallo
Un desarrollador en r/LocalLLaMA informa que prefiere Qwen3.5-27B sobre Gemini 3.1 Pro y GPT-5.3 Codex porque se rinde en tareas problemáticas en lugar de generar código potencialmente peligroso, como scripts de Perl o NodeJS sin restricciones.

Lanzado Claude Code v2.1.37
Anthropic lanza una nueva version de Claude Code con mejoras y correcciones de errores.