Método Simple de Auto-Destilación Mejora la Generación de Código en LLM

Qué hace la Auto-Distilación Simple
La auto-distilación simple (SSD) es un método de post-entrenamiento donde se muestrean soluciones de un modelo de lenguaje grande con configuraciones específicas de temperatura y truncamiento, luego se ajusta finamente el modelo en esas muestras usando ajuste fino supervisado estándar. La idea clave es que esto funciona sin necesidad de un verificador, modelo maestro o aprendizaje por refuerzo.
Mejoras de Rendimiento
En Qwen3-30B-Instruct, SSD mejoró el rendimiento pass@1 en LiveCodeBench v6 del 42.4% al 55.3%. Las ganancias se concentraron en problemas más difíciles, y el método se generalizó en modelos Qwen y Llama a escala 4B, 8B y 30B, incluyendo tanto variantes instructivas como de pensamiento.
Por qué Funciona
Los investigadores rastrearon las ganancias a un conflicto de precisión-exploración en la decodificación de LLM. SSD remodela las distribuciones de tokens de manera dependiente del contexto, suprimiendo colas distractoras donde importa la precisión mientras preserva la diversidad útil donde importa la exploración. Esto aborda la tensión fundamental entre generar código preciso y explorar diferentes enfoques de solución.
Implicaciones Prácticas
SSD ofrece una dirección complementaria de post-entrenamiento para mejorar la generación de código de LLM que es relativamente simple de implementar en comparación con métodos que requieren verificadores o aprendizaje por refuerzo. El enfoque funciona con infraestructura de ajuste fino existente y no requiere modelos adicionales o sistemas de recompensa complejos.
📖 Read the full source: HN AI Agents
👀 Ver también

«El código nunca fue la parte difícil» es un insulto a todos los programadores
Senko Rašić rechaza la afirmación de que programar es fácil y que descubrir qué construir es difícil, argumentando que ambos son difíciles y que descartar esta idea es perjudicial.

Análisis de la Campaña de Astroturfing de OpenClaw y la Inflación del Token $CLAWD
Una investigación de Reddit revela que el crecimiento viral de OpenClaw a finales de enero fue impulsado por una campaña de astroturfing recursivo que utilizó aproximadamente 400 instancias de bots, las cuales generaron expectación para inflar el token $CLAWD hasta alcanzar una capitalización de mercado de 16 millones de dólares antes de desplomarse un 90%.

OpenAI y sus rivales publican plugins de agentes: un formato de paquete para agentes de IA
OpenAI, Amazon, Microsoft, Cursor y Vercel lanzaron Agent Plugins 1.0, un estándar abierto para empaquetar extensiones de agentes de IA. Crea una vez, ejecuta en ChatGPT, Codex, Copilot, Cursor y más.

Sistema del Agente OpenClaw Roto Después de Actualizaciones Recientes
Las actualizaciones recientes de OpenClaw han roto la funcionalidad central de los agentes, con usuarios reportando que los agentes no se pueden crear o ejecutar de manera confiable. El sistema anteriormente permitía crear agentes, que aparecían correctamente, ejecutar flujos de trabajo y usarlos para tareas reales.