Ajuste Fino Autosupervisado en Errores Propios Eleva Modelos Pequeños al 80% en HumanEval

Un desarrollador en r/LocalLLaMA implementó un bucle de entrenamiento auto-supervisado donde un modelo de lenguaje pequeño genera sus propios problemas de codificación, intenta resolverlos y se ajusta finamente en los pares donde el intérprete confirma la corrección. La idea clave del artículo de DeepSeek-R1 — que los modelos pueden mejorar mediante recompensas verificables — se aplicó sin datos etiquetados por humanos.
Método
Se incitó al modelo base (comenzando con Qwen 2.5 7B) a inventar un problema de codificación y algunas pruebas pequeñas. Luego resolvió el mismo problema varias veces. El intérprete de Python actuó como único juez: se guardaron pares de (intento fallido, intento funcional). El ajuste fino se realizó sobre estas correcciones autoextraídas. No se usó código escrito por humanos en el entrenamiento.
Resultados
- Qwen 2.5 7B base: 25 → 112 en HumanEval (+87 problemas) tras corregir un error del calificador que truncaba las salidas de las funciones.
- Qwen 2.5 14B: Extrajo 100 pares, entrenó en 95 minutos en una H100 ($3.50 en créditos). Quedó a 4 puntos de la versión RLHF de la misma empresa.
- Llama 3.2 3B: 32 pares → 39 → 43 en HumanEval. Confirma la transferencia entre arquitecturas.
- Qwen 2.5 Coder 7B: Ya especializado en código, pero aún mejoró: HumanEval 83 → 87, MBPP 122 → 124.
- Qwen 3 4B: HumanEval 79 → 106 (+27), MBPP 135 → 148.
Experimento de Control
Para verificar que la señal no provenía del entrenamiento genérico, el autor construyó pares falsos con código basura aleatorio que no pasaba ninguna prueba. El entrenamiento con esos pares no produjo ninguna mejora (25/164, igual que la base). La mejora proviene específicamente del aprendizaje a partir de errores y correcciones autogenerados.
Detalles Prácticos
El intento inicial falló porque el calificador se detenía temprano, cortando las salidas del modelo a la mitad. Arreglar el calificador fue crítico. Todo el montaje funcionó en una MacBook de 24GB y una cuenta de RunPod. El código y los scripts de entrenamiento probablemente se compartieron en la publicación de Reddit.
Para Quién Es
Desarrolladores e investigadores que trabajan con modelos de lenguaje pequeños y quieren iniciar el razonamiento de código sin anotaciones humanas.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Claude Desktop vs Claude Code: Las diferencias en los prompts del sistema afectan el comportamiento de la IA
Un usuario reporta diferencias conductuales significativas entre Claude Desktop y Claude Code a pesar de usar el mismo modelo Claude Opus, cuenta y configuraciones. Las diferencias incluyen acuerdo reflexivo, consejos de bienestar no solicitados y un enfoque orientado a negocios en Desktop que no ocurren en Code.

Afirmaciones de inversión en IA del Reino Unido bajo escrutinio: centros de datos fantasmas y financiación no verificada.
Una investigación de The Guardian revela que el impulso multimillonario del Reino Unido hacia la IA incluye 'inversiones fantasma' con centros de datos alquilados, un sitio para supercomputadoras que sigue operando como depósito de andamios, y afirmaciones no verificadas sobre creación de empleos.

Diseñando un equipo de agentes: Cómo Google Antigravity estructura subagentes para la generación autónoma de código
Google Antigravity revela su arquitectura de subagentes para codificación autónoma: siete tipos de agentes especializados, desde el Centinela (recepcionista) hasta el Auditor (verificador de autenticidad). Relevante para el diseño de subagentes de OpenClaw.

Google firma un acuerdo clasificado con el Pentágono para el uso "legal" de la IA
Google supuestamente firmó un acuerdo clasificado que permite al Departamento de Defensa de EE.UU. usar sus modelos de IA para cualquier propósito gubernamental lícito, con restricciones sobre vigilancia masiva y armas autónomas solo como un acuerdo no vinculante.