Ajuste fino de Qwen2.5-7B al 96% de Claude Haiku con $3 y cero etiquetadores humanos

✍️ OpenClawRadar📅 Publicado: 11 de junio de 2026🔗 Source
Ajuste fino de Qwen2.5-7B al 96% de Claude Haiku con $3 y cero etiquetadores humanos
Ad

Un desarrollador ajustó Qwen2.5-7B para alcanzar un 96% del rendimiento compuesto de Claude Haiku en una tarea de razonamiento de decisiones específica del dominio — gastando solo ~$3 en llamadas API y usando cero etiquetadores humanos. El método, llamado DV-DPO (Optimización Directa de Preferencias Validada por Decisiones), genera señal de entrenamiento de forma autónoma ejecutando un consejo adversarial de múltiples voces.

Cómo funciona DV-DPO

El pipeline ejecuta un consejo de 3 voces en cada pregunta de decisión, produciendo una síntesis. Luego, las dos voces perdedoras examinan la síntesis de forma adversarial. Si la síntesis es revisada bajo esta presión adversarial, se forma un par DPO: la versión posterior a la revisión es la respuesta elegida, y la versión anterior es la respuesta rechazada. Si la síntesis se mantiene — no se crea ningún par. Esto asegura que solo los errores genuinos de razonamiento generen señal de entrenamiento, no preferencias de formato o varianza de muestreo.

Ad

Resultados

  • 1,040 pares de entrenamiento generados en total (~$3 a tarifas de Haiku)
  • Cara a cara contra Claude Haiku: Formato 100%, Compromisos 100%, Contexto 89%, Compuesto 96%
  • Latencia: 11s en GPU T4 (cuantizado a 4 bits) vs 3s de Haiku
  • Tasa de fallo adversarial: 2% en 96 preguntas específicas

Ciclo de mejora autónomo

El sistema ahora ejecuta un ciclo automatizado: detector_de_fallos → auto_equipo_rojo → pares_DPO → reentrenar → redistribuir → evaluar. Se están acumulando pares de la versión 5. El modelo ajustado está disponible como un archivo GGUF listo para Ollama.

Para quién es esto

Desarrolladores que construyen agentes de razonamiento específicos del dominio que quieren pasar de APIs de pago por llamada a un modelo local ajustado sin costosa anotación humana.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Qwen 3 8B supera a modelos más grandes en evaluaciones ciegas por pares en tareas difíciles.
Noticias

Qwen 3 8B supera a modelos más grandes en evaluaciones ciegas por pares en tareas difíciles.

En una evaluación ciega por pares de 10 modelos de lenguaje pequeños en 13 tareas difíciles de nivel frontera, Qwen 3 8B ganó 6 evaluaciones y se ubicó entre los 3 primeros en 12 de las 13 tareas, superando a modelos con hasta 4 veces su cantidad de parámetros. La evaluación cubrió depuración de bloqueos distribuidos, errores de concurrencia en Go, optimización SQL, diagnóstico médico bayesiano, la paradoja de Simpson, el teorema de votación de Arrow y análisis de sesgo de supervivencia.

OpenClawRadar
Los ingenieros de IA no están a salvo de ser reemplazados por la IA
Noticias

Los ingenieros de IA no están a salvo de ser reemplazados por la IA

A medida que los modelos fundacionales como DINO de Meta se vuelven de propósito general, los roles especializados de ingeniería de IA enfrentan canibalización. El autor sostiene que la mayoría de los trabajos de ingeniería de IA serán reemplazados antes que otros roles de desarrollo.

OpenClawRadar
Claude 4.6 Pensamiento Adaptativo: Usuario de Reddit Informa Desperdicio de Tokens y Proporciona Comandos de Desactivación
Noticias

Claude 4.6 Pensamiento Adaptativo: Usuario de Reddit Informa Desperdicio de Tokens y Proporciona Comandos de Desactivación

Un usuario de Reddit informa que la nueva función de pensamiento adaptativo de Claude 4.6 puede desperdiciar tokens y agregar latencia en Claude Code, proporcionando comandos de shell para desactivarla o limitar los tokens de pensamiento.

OpenClawRadar
Claude Code v2.1.187: Correcciones de salida estructurada, seguridad de sandbox y restricciones del modelo de organización
Noticias

Claude Code v2.1.187: Correcciones de salida estructurada, seguridad de sandbox y restricciones del modelo de organización

Claude Code v2.1.187 añade la opción sandbox.credentials, restricciones de modelo de organización, y correcciones para bucles de salida estructurada, bloqueos de MCP remoto y seguimiento de profundidad de subagentes.

OpenClawRadar