A receita OpenClaw-RL do Reef coloca atualizações de peso pontuadas atrás de um portão de liberação

✍️ OpenClawRadar📅 Publicado: September 14, 2026🔗 Source
Ad

Pontuar uma tarefa do OpenClaw é a parte fácil. A questão mais difícil é o que acontece com a atualização de pesos resultante antes que ela possa tocar um estado de serving em produção. O repositório da Reef traz uma receita concreta de evolução de pesos OpenClaw-RL que coloca essa atualização atrás de um portão de liberação, em vez de confiar apenas na pontuação.

A Receita, na Prática

A configuração é delimitada e específica — trate estes números como um alvo de reprodução, não como um benchmark geral:

  • 72 problemas do GSM8K tratados como 72 tarefas — cada problema é sua própria unidade de tarefa no loop.
  • Qwen3-4B cuida dos papéis de política e modelo de recompensa de processo.
  • Qwen3-32B é o aluno.
  • Sete GPUs para a execução.
  • O projeto relata ter atingido seu critério de três aprovações consecutivas na sessão 14.
  • A curva de aprendizado versionada cobre as primeiras 36 sessões.

A lógica de gating é a parte interessante. Uma atualização pontuada não é promovida para substituir a versão em produção até passar em um teste — neste caso, três aprovações consecutivas. Essa é a diferença entre "o modelo de recompensa gostou" e "é seguro servir"

Ad

O Que Esses Números São (e O Que Não São)

Eles são um alvo de reprodução. Não servem de benchmark para toda carga de trabalho do OpenClaw, e não estabelecem um adaptador genérico de harness OpenClaw. Se você ler a curva de sessão 14 / 36 sessões como uma afirmação universal, está lendo errado. É uma receita em uma família de tarefas (GSM8K) com uma pilha de modelos.

Primeiro Passo Sugerido

Se você quer fazer uma verificação de sanidade da abordagem antes de adaptá-la:

  1. Comece com uma tarefa do OpenClaw que tenha um verificador objetivo — nada de pontuação baseada em vibes.
  2. Reproduza a receita como está.
  3. Confirme que um candidato de pesos deliberadamente ruim não consegue mover o estado de serving. Essa é a propriedade do portão de liberação que realmente importa.
  4. Só depois que isso passar vale a pena perguntar se a otimização se transfere para sua tarefa real.

O passo 3 é o que as pessoas pulam. Se uma atualização ruim consegue passar pelo portão, o resto do pipeline é decoração.

Para Quem É Isso

Desenvolvedores construindo loops de evolução de pesos no estilo RL em cima do OpenClaw que querem uma referência funcional para gating de promoções, em vez de um pipeline abstrato de "pontuou bem, manda pra produção".

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also