Рецепт OpenClaw-RL от Reef ставит обновления весов со счётом за шлюзом выпуска

✍️ OpenClawRadar📅 Опубликовано: 14 сентября 2026 г.🔗 Source
Ad

Оценить задачу OpenClaw — это простая часть. Куда сложнее вопрос: что произойдёт с полученным обновлением весов, прежде чем ему позволят коснуться рабочего serving-состояния. В репозитории Reef есть конкретный рецепт эволюции весов OpenClaw-RL, который ставит это обновление за release-гейт, а не доверяет одной лишь оценке.

Рецепт конкретно

Конфигурация ограничена и конкретна — воспринимайте эти числа как цель для воспроизведения, а не как общий бенчмарк:

  • 72 задачи GSM8K рассматриваются как 72 задачи — каждая задача является отдельной единицей в цикле.
  • Qwen3-4B выполняет роли политики и модели процессного вознаграждения.
  • Qwen3-32B — студент.
  • Семь GPU для запуска.
  • Проект сообщает о достижении критерия трёх последовательных прохождений на 14-й сессии.
  • Закоммиченная кривая обучения охватывает первые 36 сессий.

Логика гейтинга — самая интересная часть. Оценённое обновление не повышается до замены рабочей версии, пока не пройдёт проверку — в данном случае три последовательных прохождения. В этом и разница между «модель вознаграждения одобрила» и «это безопасно отдавать в продакшен».

Ad

Что эти числа означают (и не означают)

Это цель для воспроизведения. Они не бенчмаркают все рабочие нагрузки OpenClaw и не устанавливают универсальный адаптер харнесса OpenClaw. Если вы читаете кривую 14-й сессии из 36 как универсальное утверждение, вы читаете её неправильно. Это один рецепт на одном семействе задач (GSM8K) с одним стеком моделей.

Рекомендуемый первый шаг

Если вы хотите проверить подход на вменяемость, прежде чем адаптировать его:

  1. Начните с задачи OpenClaw, у которой есть объективный верификатор — никакой оценки «на ощущениях».
  2. Воспроизведите рецепт как есть.
  3. Убедитесь, что намеренно плохой кандидат весов не может изменить serving-состояние. Именно это свойство release-гейта вас на самом деле интересует.
  4. И только после того, как это пройдёт, стоит спрашивать, переносится ли оптимизация на вашу реальную задачу.

Шаг 3 — тот, который люди пропускают. Если мусорное обновление может проскользнуть через гейт, остальной пайплайн — просто декорация.

Для кого это

Для разработчиков, строящих циклы эволюции весов в стиле RL поверх OpenClaw, которым нужен рабочий референс для гейтинга промоушенов, а не абстрактный пайплайн «оценка хорошая — отгружаем».

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

soul.py добавляет постоянную память локальным LLM с помощью простого файлового подхода.
Инструменты

soul.py добавляет постоянную память локальным LLM с помощью простого файлового подхода.

soul.py — это библиотека Python, которая добавляет постоянную память любому LLM, используя два файла в формате markdown для идентификации и ведения журнала разговоров, работая с моделями Ollama, OpenAI и Anthropic без необходимости в базах данных или серверах.

OpenClawRadar
Каркас Scaffold решает проблемы с памятью кода и рабочими процессами Claude
Инструменты

Каркас Scaffold решает проблемы с памятью кода и рабочими процессами Claude

Scaffold — это 17-навыковый фреймворк для Claude Code, который обеспечивает постоянную память, принудительное принятие решений и контрольные точки рабочих процессов. Он использует 3-уровневую систему маршрутизации моделей для экономии токенов и может быть установлен через меню плагинов Claude Code.

OpenClawRadar
Берега: Контейнеризованные хосты для запуска нескольких локальных сред
Инструменты

Берега: Контейнеризованные хосты для запуска нескольких локальных сред

Coasts — это решение Docker-in-Docker, которое решает проблему одновременного запуска нескольких локальных сред, автоматически обрабатывая конфликты портов, секреты и топологии томов без необходимости сложных скриптов.

OpenClawRadar
Аналитик данных создает инструмент калибровки промптов с помощью Claude без опыта во фронтенд-разработке.
Инструменты

Аналитик данных создает инструмент калибровки промптов с помощью Claude без опыта во фронтенд-разработке.

Аналитик данных без опыта в HTML, CSS или JavaScript создал Prompt Calibrator — клиентский веб-инструмент, который структурирует промпты для ИИ через форму с четырьмя полями и четырьмя режимами. Инструмент был разработан с использованием Claude в качестве партнёра по ревью кода и размещён на GitHub Pages.

OpenClawRadar