La receta OpenClaw-RL de Reef coloca actualizaciones de peso puntuadas detrás de una puerta de lanzamiento

✍️ OpenClawRadar📅 Publicado: 14 de septiembre de 2026🔗 Source
Ad

Puntuar una tarea de OpenClaw es lo fácil. La pregunta difícil es qué ocurre con la actualización de pesos resultante antes de que se le permita tocar un estado de servicio en funcionamiento. El repositorio de Reef incluye una receta concreta de evolución de pesos OpenClaw-RL que somete esa actualización a una compuerta de liberación en lugar de confiar únicamente en la puntuación.

La receta, en concreto

La configuración está acotada y es específica: trata estas cifras como un objetivo de reproducción, no como un benchmark general:

  • 72 problemas GSM8K tratados como 72 tareas: cada problema es su propia unidad de tarea en el bucle.
  • Qwen3-4B se encarga de los roles de política y de modelo de recompensa de proceso.
  • Qwen3-32B es el estudiante.
  • Siete GPUs para la ejecución.
  • El proyecto informa haber cumplido su criterio de tres pases consecutivos en la sesión 14.
  • La curva de aprendizaje registrada cubre las primeras 36 sesiones.

La lógica de la compuerta es la pieza interesante. Una actualización puntuada no se promueve para reemplazar la versión en funcionamiento hasta que supera una prueba; en este caso, tres pases consecutivos. Esa es la diferencia entre "al modelo de recompensa le gustó" y "es seguro servirla".

Ad

Qué son estas cifras (y qué no son)

Son un objetivo de reproducción. No evalúan todas las cargas de trabajo de OpenClaw ni establecen un adaptador genérico de harness de OpenClaw. Si lees la curva de la sesión 14 / 36 sesiones como una afirmación universal, la estás interpretando mal. Es una receta sobre una familia de tareas (GSM8K) con una pila de modelos.

Primer movimiento sugerido

Si quieres comprobar el enfoque antes de adaptarlo:

  1. Empieza con una tarea de OpenClaw que tenga un verificador objetivo: nada de puntuaciones basadas en corazonadas.
  2. Reproduce la receta tal cual.
  3. Confirma que un candidato de pesos deliberadamente malo no puede mover el estado de servicio. Esa es la propiedad de la compuerta de liberación que realmente te importa.
  4. Solo después de que eso pase vale la pena preguntar si la optimización se transfiere a tu tarea real.

El paso 3 es el que la gente se salta. Si una actualización basura puede colarse por la compuerta, el resto del pipeline es decoración.

Para quién es esto

Desarrolladores que construyen bucles de evolución de pesos estilo RL sobre OpenClaw y quieren una referencia funcional para controlar las promociones en lugar de un pipeline abstracto de "puntuó bien, publícalo".

📖 Lee la fuente completa: r/openclaw

Ad

👀 Ver también

Port de Go de código abierto de Claude Code CLI lanzado como claw-code-go
Herramientas

Port de Go de código abierto de Claude Code CLI lanzado como claw-code-go

El desarrollador dolm09 ha lanzado claw-code-go, un port completo en Go de la CLI de Claude Code con un binario autónomo de menos de 10K líneas de código. El proyecto incluye una TUI con bubbletea, soporte multi-proveedor, cliente MCP y motor de ejecución de herramientas.

OpenClawRadar
La Aplicación de Escritorio de Claude Agrega la Función de Proyectos a la Interfaz de Trabajo en Equipo
Herramientas

La Aplicación de Escritorio de Claude Agrega la Función de Proyectos a la Interfaz de Trabajo en Equipo

La aplicación de escritorio de Claude ahora incluye una función de Proyectos en Cowork, que permite a los usuarios organizar tareas y contexto en espacios de trabajo dedicados. Los archivos e instrucciones permanecen en el ordenador local del usuario, con opciones para importar proyectos existentes o comenzar nuevos.

OpenClawRadar
8 Consejos Avanzados de Claude Code: Ahorro de Costos, Gestión de Contexto, Comandos Personalizados
Herramientas

8 Consejos Avanzados de Claude Code: Ahorro de Costos, Gestión de Contexto, Comandos Personalizados

Consejos prácticos del uso diario intensivo de Claude Code, que cubren automatización del flujo de trabajo de git, entrada de imágenes multimodales, seguimiento del uso de la API, compactación de contexto, reanudación de sesiones, gestión de reglas, desencadenadores de pensamiento y comandos personalizados.

OpenClawRadar
DeepClaude reemplaza el backend Anthropic de Claude Code por DeepSeek V4 Pro con un costo 17 veces menor
Herramientas

DeepClaude reemplaza el backend Anthropic de Claude Code por DeepSeek V4 Pro con un costo 17 veces menor

Un script que reescribe las variables de entorno de Claude Code para enrutar todas las llamadas del bucle del agente a través de DeepSeek V4 Pro, OpenRouter o Fireworks AI — misma experiencia de usuario, $0.87/M tokens de salida vs $15/M.

OpenClawRadar