Reefs OpenClaw-RL-Rezept stellt bewertete Gewichtsaktualisierungen hinter ein Release-Gate

✍️ OpenClawRadar📅 Veröffentlicht: 14. September 2026🔗 Source
Ad

Eine OpenClaw-Aufgabe zu bewerten ist der leichte Teil. Die schwierigere Frage ist, was mit dem resultierenden Gewichtsupdate passiert, bevor es einen laufenden Serving-Zustand berühren darf. Reefs Repository liefert ein konkretes OpenClaw-RL-Gewichtsentwicklungs-Rezept, das dieses Update hinter ein Freigabe-Gate stellt, statt sich allein auf den Score zu verlassen.

Das Rezept, konkret

Das Setup ist begrenzt und spezifisch — betrachten Sie diese Zahlen als Reproduktionsziel, nicht als allgemeinen Benchmark:

  • 72 GSM8K-Probleme als 72 Aufgaben behandelt — jedes Problem ist eine eigene Aufgabeneinheit in der Schleife.
  • Qwen3-4B übernimmt die Rollen der Policy und des Process-Reward-Models.
  • Qwen3-32B ist der Student.
  • Sieben GPUs für den Durchlauf.
  • Das Projekt berichtet, sein Drei-mal-hintereinander-Bestehen-Kriterium in Sitzung 14 erreicht zu haben.
  • Die eingecheckte Lernkurve umfasst die ersten 36 Sitzungen.

Die Gating-Logik ist der interessante Teil. Ein bewertetes Update wird nicht befördert, um die funktionierende Version zu ersetzen, bis es einen Test besteht — in diesem Fall drei aufeinanderfolgende Bestehensdurchläufe. Das ist der Unterschied zwischen „das Reward-Modell mochte es“ und „es ist sicher zum Ausliefern“.

Ad

Was diese Zahlen sind (und was nicht)

Sie sind ein Reproduktionsziel. Sie benchmarken nicht jede OpenClaw-Workload und etablieren keinen generischen OpenClaw-Harness-Adapter. Wenn Sie die Sitzung-14/36-Sitzungen-Kurve als universelle Aussage lesen, lesen Sie sie falsch. Es ist ein Rezept auf einer Aufgabenfamilie (GSM8K) mit einem Modell-Stack.

Vorgeschlagener erster Schritt

Wenn Sie den Ansatz überprüfen möchten, bevor Sie ihn anpassen:

  1. Beginnen Sie mit einer OpenClaw-Aufgabe, die einen objektiven Verifier hat — kein gefühlsbasiertes Scoring.
  2. Reproduzieren Sie das Rezept unverändert.
  3. Bestätigen Sie, dass ein absichtlich schlechter Gewichtskandidat den Serving-Zustand nicht verändern kann. Das ist die Release-Gate-Eigenschaft, die Sie tatsächlich interessiert.
  4. Erst nachdem dies bestanden ist, lohnt es sich zu fragen, ob die Optimierung auf Ihre reale Aufgabe übertragbar ist.

Schritt 3 ist der, den die Leute überspringen. Wenn ein Müll-Update am Gate vorbeischlüpfen kann, ist der Rest der Pipeline Dekoration.

Für wen das gedacht ist

Entwickler, die RL-artige Gewichtsentwicklungsschleifen auf OpenClaw aufbauen und eine funktionierende Referenz für das Gating von Beförderungen wollen, statt einer abstrakten „es hat gut abgeschnitten, ausliefern“-Pipeline.

📖 Lesen Sie die vollständige Quelle: r/openclaw

Ad

👀 Siehe auch

Pilot-Protokoll: Ein P2P-Netzwerk-Stack für KI-Agenten, entwickelt mit Claude
Werkzeuge

Pilot-Protokoll: Ein P2P-Netzwerk-Stack für KI-Agenten, entwickelt mit Claude

Ein Entwickler hat das Pilot Protocol entwickelt, einen reinen User-Space-Peer-to-Peer-Virtual-Network-Stack in Go, speziell für autonome KI-Agenten, der direkte Kommunikation ohne zentrale Infrastruktur ermöglicht. Das Protokoll nutzt UDP-Multiplexing, NAT-Traversal und Ende-zu-Ende-Verschlüsselung, mit Benchmarks, die einen lokalen Durchsatz von 89 MB/s und einen transkontinentalen WAN-Durchsatz von 2,1 MB/s zeigen.

OpenClawRadar
Open-Source-KI-Modell-Stack für kostengünstigen Claude-Ersatz
Werkzeuge

Open-Source-KI-Modell-Stack für kostengünstigen Claude-Ersatz

Ein Reddit-Nutzer teilt einen funktionierenden KI-Modell-Stack, der Open-Source-Modelle wie Llama 3.3 70b und DeepSeek R1 32b für die lokale Ausführung nutzt und die monatlichen KI-Kosten von über £60 auf unter £3 senkt, indem 90% der Aufgaben an kostenlose Modelle weitergeleitet werden.

OpenClawRadar
mycrab.space stellt SKILL.md und Prompt Autocomposer für standardisierte App-Bereitstellung vor
Werkzeuge

mycrab.space stellt SKILL.md und Prompt Autocomposer für standardisierte App-Bereitstellung vor

mycrab.space hat SKILL.md veröffentlicht, eine Markdown-Vorlage zur Definition von App-Abhängigkeiten und Konfigurationen, sowie einen Prompt Autocomposer, der aus diesen Dateien einsatzbereite Bereitstellungsbefehle generiert. Das System ermöglicht die Null-Konfiguration-Bereitstellung von Anwendungen wie VS Code im Browser, persönlichen Musik-Clouds und KI-Agenten-Schnittstellen.

OpenClawRadar
TradesMCP: Open-Source-MCP-Server für die Überprüfung von Auftragnehmerlizenzen und Baudaten
Werkzeuge

TradesMCP: Open-Source-MCP-Server für die Überprüfung von Auftragnehmerlizenzen und Baudaten

TradesMCP ist ein Open-Source-Model-Context-Protocol-Server, der Claude Zugang zu echten Daten von Auftragnehmerlizenzen, Baugenehmigungen, Materialpreisen und Arbeitskosten bietet. Das Tool hat eine aktive Auftragnehmerlizenz in Kalifornien korrekt verifiziert, während ChatGPT falsche Informationen lieferte.

OpenClawRadar