Рецепт OpenClaw-RL от Reef ставит обновления весов со счётом за шлюзом выпуска
Оценить задачу OpenClaw — это простая часть. Куда сложнее вопрос: что произойдёт с полученным обновлением весов, прежде чем ему позволят коснуться рабочего serving-состояния. В репозитории Reef есть конкретный рецепт эволюции весов OpenClaw-RL, который ставит это обновление за release-гейт, а не доверяет одной лишь оценке.
Рецепт конкретно
Конфигурация ограничена и конкретна — воспринимайте эти числа как цель для воспроизведения, а не как общий бенчмарк:
- 72 задачи GSM8K рассматриваются как 72 задачи — каждая задача является отдельной единицей в цикле.
- Qwen3-4B выполняет роли политики и модели процессного вознаграждения.
- Qwen3-32B — студент.
- Семь GPU для запуска.
- Проект сообщает о достижении критерия трёх последовательных прохождений на 14-й сессии.
- Закоммиченная кривая обучения охватывает первые 36 сессий.
Логика гейтинга — самая интересная часть. Оценённое обновление не повышается до замены рабочей версии, пока не пройдёт проверку — в данном случае три последовательных прохождения. В этом и разница между «модель вознаграждения одобрила» и «это безопасно отдавать в продакшен».
Что эти числа означают (и не означают)
Это цель для воспроизведения. Они не бенчмаркают все рабочие нагрузки OpenClaw и не устанавливают универсальный адаптер харнесса OpenClaw. Если вы читаете кривую 14-й сессии из 36 как универсальное утверждение, вы читаете её неправильно. Это один рецепт на одном семействе задач (GSM8K) с одним стеком моделей.
Рекомендуемый первый шаг
Если вы хотите проверить подход на вменяемость, прежде чем адаптировать его:
- Начните с задачи OpenClaw, у которой есть объективный верификатор — никакой оценки «на ощущениях».
- Воспроизведите рецепт как есть.
- Убедитесь, что намеренно плохой кандидат весов не может изменить serving-состояние. Именно это свойство release-гейта вас на самом деле интересует.
- И только после того, как это пройдёт, стоит спрашивать, переносится ли оптимизация на вашу реальную задачу.
Шаг 3 — тот, который люди пропускают. Если мусорное обновление может проскользнуть через гейт, остальной пайплайн — просто декорация.
Для кого это
Для разработчиков, строящих циклы эволюции весов в стиле RL поверх OpenClaw, которым нужен рабочий референс для гейтинга промоушенов, а не абстрактный пайплайн «оценка хорошая — отгружаем».
📖 Читать полный источник: r/openclaw
👀 Смотрите также

soul.py добавляет постоянную память локальным LLM с помощью простого файлового подхода.
soul.py — это библиотека Python, которая добавляет постоянную память любому LLM, используя два файла в формате markdown для идентификации и ведения журнала разговоров, работая с моделями Ollama, OpenAI и Anthropic без необходимости в базах данных или серверах.

Каркас Scaffold решает проблемы с памятью кода и рабочими процессами Claude
Scaffold — это 17-навыковый фреймворк для Claude Code, который обеспечивает постоянную память, принудительное принятие решений и контрольные точки рабочих процессов. Он использует 3-уровневую систему маршрутизации моделей для экономии токенов и может быть установлен через меню плагинов Claude Code.

Берега: Контейнеризованные хосты для запуска нескольких локальных сред
Coasts — это решение Docker-in-Docker, которое решает проблему одновременного запуска нескольких локальных сред, автоматически обрабатывая конфликты портов, секреты и топологии томов без необходимости сложных скриптов.

Аналитик данных создает инструмент калибровки промптов с помощью Claude без опыта во фронтенд-разработке.
Аналитик данных без опыта в HTML, CSS или JavaScript создал Prompt Calibrator — клиентский веб-инструмент, который структурирует промпты для ИИ через форму с четырьмя полями и четырьмя режимами. Инструмент был разработан с использованием Claude в качестве партнёра по ревью кода и размещён на GitHub Pages.