Ajuste fino de Qwen2.5-7B al 96% de Claude Haiku con $3 y cero etiquetadores humanos

✍️ OpenClawRadar📅 Publicado: 11 de junio de 2026🔗 Source
Ajuste fino de Qwen2.5-7B al 96% de Claude Haiku con $3 y cero etiquetadores humanos
Ad

Un desarrollador ajustó Qwen2.5-7B para alcanzar un 96% del rendimiento compuesto de Claude Haiku en una tarea de razonamiento de decisiones específica del dominio — gastando solo ~$3 en llamadas API y usando cero etiquetadores humanos. El método, llamado DV-DPO (Optimización Directa de Preferencias Validada por Decisiones), genera señal de entrenamiento de forma autónoma ejecutando un consejo adversarial de múltiples voces.

Cómo funciona DV-DPO

El pipeline ejecuta un consejo de 3 voces en cada pregunta de decisión, produciendo una síntesis. Luego, las dos voces perdedoras examinan la síntesis de forma adversarial. Si la síntesis es revisada bajo esta presión adversarial, se forma un par DPO: la versión posterior a la revisión es la respuesta elegida, y la versión anterior es la respuesta rechazada. Si la síntesis se mantiene — no se crea ningún par. Esto asegura que solo los errores genuinos de razonamiento generen señal de entrenamiento, no preferencias de formato o varianza de muestreo.

Ad

Resultados

  • 1,040 pares de entrenamiento generados en total (~$3 a tarifas de Haiku)
  • Cara a cara contra Claude Haiku: Formato 100%, Compromisos 100%, Contexto 89%, Compuesto 96%
  • Latencia: 11s en GPU T4 (cuantizado a 4 bits) vs 3s de Haiku
  • Tasa de fallo adversarial: 2% en 96 preguntas específicas

Ciclo de mejora autónomo

El sistema ahora ejecuta un ciclo automatizado: detector_de_fallos → auto_equipo_rojo → pares_DPO → reentrenar → redistribuir → evaluar. Se están acumulando pares de la versión 5. El modelo ajustado está disponible como un archivo GGUF listo para Ollama.

Para quién es esto

Desarrolladores que construyen agentes de razonamiento específicos del dominio que quieren pasar de APIs de pago por llamada a un modelo local ajustado sin costosa anotación humana.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Anthropic Bloquea las Suscripciones a Claude a través de Herramientas de Terceros
Noticias

Anthropic Bloquea las Suscripciones a Claude a través de Herramientas de Terceros

Anthropic ha implementado bloqueos del lado del servidor en las suscripciones de Claude Pro/Max utilizadas a través de integraciones de OAuth de terceros, citando que se estaba aprovechando el acceso subsidiado a gran escala. El cambio de política incluye facturación de 'Uso Extra' que hace que estas integraciones no sean económicamente viables.

OpenClawRadar
sseanliu/VisionClaw trae asistencia de IA en tiempo real a las gafas inteligentes Meta Ray-Ban.
Noticias

sseanliu/VisionClaw trae asistencia de IA en tiempo real a las gafas inteligentes Meta Ray-Ban.

La VisiónClaw de sseanliu ofrece un asistente de IA revolucionario para las gafas inteligentes Meta Ray-Ban, combinando voz, visión y acciones autónomas impulsadas por Gemini Live y OpenClaw.

OpenClawRadar
🦀
Noticias

La IA está resolviendo desafíos CTF en minutos — qué significa esto para la formación en ciberseguridad

En BSidesSF 2026, un agente autónomo resolvió los 52 desafíos CTF en minutos, ganando el primer lugar. Esto obliga a repensar cómo se miden y entrenan las habilidades de ciberseguridad.

OpenClawRadar
Sistema del Agente OpenClaw Roto Después de Actualizaciones Recientes
Noticias

Sistema del Agente OpenClaw Roto Después de Actualizaciones Recientes

Las actualizaciones recientes de OpenClaw han roto la funcionalidad central de los agentes, con usuarios reportando que los agentes no se pueden crear o ejecutar de manera confiable. El sistema anteriormente permitía crear agentes, que aparecían correctamente, ejecutar flujos de trabajo y usarlos para tareas reales.

OpenClawRadar