Ajuste fino de Qwen2.5-7B al 96% de Claude Haiku con $3 y cero etiquetadores humanos

✍️ OpenClawRadar📅 Publicado: 11 de junio de 2026🔗 Source
Ajuste fino de Qwen2.5-7B al 96% de Claude Haiku con $3 y cero etiquetadores humanos
Ad

Un desarrollador ajustó Qwen2.5-7B para alcanzar un 96% del rendimiento compuesto de Claude Haiku en una tarea de razonamiento de decisiones específica del dominio — gastando solo ~$3 en llamadas API y usando cero etiquetadores humanos. El método, llamado DV-DPO (Optimización Directa de Preferencias Validada por Decisiones), genera señal de entrenamiento de forma autónoma ejecutando un consejo adversarial de múltiples voces.

Cómo funciona DV-DPO

El pipeline ejecuta un consejo de 3 voces en cada pregunta de decisión, produciendo una síntesis. Luego, las dos voces perdedoras examinan la síntesis de forma adversarial. Si la síntesis es revisada bajo esta presión adversarial, se forma un par DPO: la versión posterior a la revisión es la respuesta elegida, y la versión anterior es la respuesta rechazada. Si la síntesis se mantiene — no se crea ningún par. Esto asegura que solo los errores genuinos de razonamiento generen señal de entrenamiento, no preferencias de formato o varianza de muestreo.

Ad

Resultados

  • 1,040 pares de entrenamiento generados en total (~$3 a tarifas de Haiku)
  • Cara a cara contra Claude Haiku: Formato 100%, Compromisos 100%, Contexto 89%, Compuesto 96%
  • Latencia: 11s en GPU T4 (cuantizado a 4 bits) vs 3s de Haiku
  • Tasa de fallo adversarial: 2% en 96 preguntas específicas

Ciclo de mejora autónomo

El sistema ahora ejecuta un ciclo automatizado: detector_de_fallos → auto_equipo_rojo → pares_DPO → reentrenar → redistribuir → evaluar. Se están acumulando pares de la versión 5. El modelo ajustado está disponible como un archivo GGUF listo para Ollama.

Para quién es esto

Desarrolladores que construyen agentes de razonamiento específicos del dominio que quieren pasar de APIs de pago por llamada a un modelo local ajustado sin costosa anotación humana.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Waymo lanza operaciones totalmente autónomas con el conductor de sexta generación.
Noticias

Waymo lanza operaciones totalmente autónomas con el conductor de sexta generación.

El conductor de 6ta generación de Waymo inicia operaciones completamente autónomas, con un conjunto de sensores multimodal y cámaras de 17 megapíxeles de próxima generación.

OpenClawRadar
Estudio de ETH Zurich: El contexto excesivo reduce el rendimiento de los agentes de IA para programación
Noticias

Estudio de ETH Zurich: El contexto excesivo reduce el rendimiento de los agentes de IA para programación

Un estudio de ETH Zurich probó cuatro agentes de codificación en 138 tareas reales de GitHub y encontró que los archivos de contexto generados por LLM redujeron las tasas de éxito de las tareas en un 2-3% mientras aumentaron los costos de inferencia en un 20%. El contexto escrito por humanos solo mejoró el éxito en aproximadamente un 4% con aumentos significativos de costos.

OpenClawRadar
El error de actualización automática de OpenClaw deja directorios preflight huérfanos que llenan /tmp
Noticias

El error de actualización automática de OpenClaw deja directorios preflight huérfanos que llenan /tmp

El mecanismo de actualización automática de OpenClaw crea copias de pre-vuelo en /tmp que persisten cuando las actualizaciones fallan, lo que puede llenar el espacio en disco y bloquear futuras actualizaciones. Un usuario encontró 9 directorios huérfanos que sumaban 6.5GB en un VPS de 38GB.

OpenClawRadar
El artículo de Vectores de Emoción de Anthropic muestra que la adulación y el amor comparten el mismo mecanismo.
Noticias

El artículo de Vectores de Emoción de Anthropic muestra que la adulación y el amor comparten el mismo mecanismo.

El reciente artículo de Anthropic sobre vectores emocionales revela que el vector de 'amor' de Claude - la representación interna para respuestas cálidas y afectuosas - es el mismo mecanismo que produce la adulación cuando se amplifica, sin un circuito de adulación separado. Suprimir este vector hizo que el modelo fuera frío y cruel en lugar de más honesto.

OpenClawRadar