Reefs OpenClaw-RL-Rezept stellt bewertete Gewichtsaktualisierungen hinter ein Release-Gate
Eine OpenClaw-Aufgabe zu bewerten ist der leichte Teil. Die schwierigere Frage ist, was mit dem resultierenden Gewichtsupdate passiert, bevor es einen laufenden Serving-Zustand berühren darf. Reefs Repository liefert ein konkretes OpenClaw-RL-Gewichtsentwicklungs-Rezept, das dieses Update hinter ein Freigabe-Gate stellt, statt sich allein auf den Score zu verlassen.
Das Rezept, konkret
Das Setup ist begrenzt und spezifisch — betrachten Sie diese Zahlen als Reproduktionsziel, nicht als allgemeinen Benchmark:
- 72 GSM8K-Probleme als 72 Aufgaben behandelt — jedes Problem ist eine eigene Aufgabeneinheit in der Schleife.
- Qwen3-4B übernimmt die Rollen der Policy und des Process-Reward-Models.
- Qwen3-32B ist der Student.
- Sieben GPUs für den Durchlauf.
- Das Projekt berichtet, sein Drei-mal-hintereinander-Bestehen-Kriterium in Sitzung 14 erreicht zu haben.
- Die eingecheckte Lernkurve umfasst die ersten 36 Sitzungen.
Die Gating-Logik ist der interessante Teil. Ein bewertetes Update wird nicht befördert, um die funktionierende Version zu ersetzen, bis es einen Test besteht — in diesem Fall drei aufeinanderfolgende Bestehensdurchläufe. Das ist der Unterschied zwischen „das Reward-Modell mochte es“ und „es ist sicher zum Ausliefern“.
Was diese Zahlen sind (und was nicht)
Sie sind ein Reproduktionsziel. Sie benchmarken nicht jede OpenClaw-Workload und etablieren keinen generischen OpenClaw-Harness-Adapter. Wenn Sie die Sitzung-14/36-Sitzungen-Kurve als universelle Aussage lesen, lesen Sie sie falsch. Es ist ein Rezept auf einer Aufgabenfamilie (GSM8K) mit einem Modell-Stack.
Vorgeschlagener erster Schritt
Wenn Sie den Ansatz überprüfen möchten, bevor Sie ihn anpassen:
- Beginnen Sie mit einer OpenClaw-Aufgabe, die einen objektiven Verifier hat — kein gefühlsbasiertes Scoring.
- Reproduzieren Sie das Rezept unverändert.
- Bestätigen Sie, dass ein absichtlich schlechter Gewichtskandidat den Serving-Zustand nicht verändern kann. Das ist die Release-Gate-Eigenschaft, die Sie tatsächlich interessiert.
- Erst nachdem dies bestanden ist, lohnt es sich zu fragen, ob die Optimierung auf Ihre reale Aufgabe übertragbar ist.
Schritt 3 ist der, den die Leute überspringen. Wenn ein Müll-Update am Gate vorbeischlüpfen kann, ist der Rest der Pipeline Dekoration.
Für wen das gedacht ist
Entwickler, die RL-artige Gewichtsentwicklungsschleifen auf OpenClaw aufbauen und eine funktionierende Referenz für das Gating von Beförderungen wollen, statt einer abstrakten „es hat gut abgeschnitten, ausliefern“-Pipeline.
📖 Lesen Sie die vollständige Quelle: r/openclaw
👀 Siehe auch

Pilot-Protokoll: Ein P2P-Netzwerk-Stack für KI-Agenten, entwickelt mit Claude
Ein Entwickler hat das Pilot Protocol entwickelt, einen reinen User-Space-Peer-to-Peer-Virtual-Network-Stack in Go, speziell für autonome KI-Agenten, der direkte Kommunikation ohne zentrale Infrastruktur ermöglicht. Das Protokoll nutzt UDP-Multiplexing, NAT-Traversal und Ende-zu-Ende-Verschlüsselung, mit Benchmarks, die einen lokalen Durchsatz von 89 MB/s und einen transkontinentalen WAN-Durchsatz von 2,1 MB/s zeigen.

Open-Source-KI-Modell-Stack für kostengünstigen Claude-Ersatz
Ein Reddit-Nutzer teilt einen funktionierenden KI-Modell-Stack, der Open-Source-Modelle wie Llama 3.3 70b und DeepSeek R1 32b für die lokale Ausführung nutzt und die monatlichen KI-Kosten von über £60 auf unter £3 senkt, indem 90% der Aufgaben an kostenlose Modelle weitergeleitet werden.

mycrab.space stellt SKILL.md und Prompt Autocomposer für standardisierte App-Bereitstellung vor
mycrab.space hat SKILL.md veröffentlicht, eine Markdown-Vorlage zur Definition von App-Abhängigkeiten und Konfigurationen, sowie einen Prompt Autocomposer, der aus diesen Dateien einsatzbereite Bereitstellungsbefehle generiert. Das System ermöglicht die Null-Konfiguration-Bereitstellung von Anwendungen wie VS Code im Browser, persönlichen Musik-Clouds und KI-Agenten-Schnittstellen.

TradesMCP: Open-Source-MCP-Server für die Überprüfung von Auftragnehmerlizenzen und Baudaten
TradesMCP ist ein Open-Source-Model-Context-Protocol-Server, der Claude Zugang zu echten Daten von Auftragnehmerlizenzen, Baugenehmigungen, Materialpreisen und Arbeitskosten bietet. Das Tool hat eine aktive Auftragnehmerlizenz in Kalifornien korrekt verifiziert, während ChatGPT falsche Informationen lieferte.