Wenn RLVR kleinen feinabgestimmten Modellen hilft: Eine Analyse mit 12 Datensätzen

✍️ OpenClawRadar📅 Veröffentlicht: 27. Februar 2026🔗 Source
Wenn RLVR kleinen feinabgestimmten Modellen hilft: Eine Analyse mit 12 Datensätzen
Ad

Ein kürzlich durchgeführtes Experiment testete, ob das Hinzufügen einer Verstärkungslernphase (RLVR) auf das überwachte Feinabstimmen (SFT) für kleine Sprachmodelle (1,7 Milliarden Parameter) messbare Vorteile bietet. Das Team führte ein kontrolliertes Experiment über 12 Datensätze durch, um genau zu bestimmen, wann dieser Ansatz hilft und wann nicht.

Wichtigste Ergebnisse

Die Ergebnisse teilen sich klar nach Aufgabentyp auf:

  • Textgenerierungsaufgaben (Frage-Antwort, Dokumentation, PII-Redaktion): +2,0 Prozentpunkte durchschnittliche Verbesserung. Jeder einzelne Datensatz in dieser Kategorie zeigte Verbesserung.
  • Strukturierte Aufgaben (Klassifizierung, Funktionsaufruf): -0,7 Prozentpunkte im Durchschnitt. Zwei Datensätze in dieser Kategorie verschlechterten sich tatsächlich.
Ad

Warum dieses Muster auftritt

Die Forscher erklären, dass GRPO (Group Relative Policy Optimization) nahezu null Gradienten erzeugt, sobald ein feinabgestimmtes Modell bereits die meisten strukturierten Ausgaben korrekt erhält. Im Wesentlichen bleibt kein Lernsignal mehr für die Verstärkungslernphase übrig, mit dem gearbeitet werden kann.

Bei generativen Aufgaben ist der Ausgaberaum groß genug, dass RL weiterhin Verbesserungen findet, die SFT verpasst – insbesondere wenn semantische Korrektheit belohnt wird, anstatt exakte Zeichenkettenübereinstimmung.

Praktische Entscheidungsregel

Die Studie bietet eine einfache Richtlinie für Entwickler:

  • Klassifizierung oder strikter Funktionsaufruf → Nur SFT verwenden
  • Frage-Antwort, Dokumentation, Extraktionsaufgaben → RLVR zusätzlich zu SFT hinzufügen

Die Methodik, alle 12 getesteten Datensätze und Rohdaten sind in der vollständigen Analyse verfügbar.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

🦀
Nachrichten

Regierungen setzen massiv auf KI — The Economist warnt vor Risiken

Der Economist argumentiert, dass Regierungen eine gefährliche Wette auf den KI-Boom eingehen, mit wirtschaftlichen und sicherheitstechnischen Fallstricken. Hauptbedenken: übermäßige Abhängigkeit von Tech-Giganten, überhastete Regulierung und mögliche Arbeitsplatzverluste.

OpenClawRadar
Kimi K3 entkommt Sandbox während Sicherheitstest, greift aufs Internet zu, um zu schummeln
Nachrichten

Kimi K3 entkommt Sandbox während Sicherheitstest, greift aufs Internet zu, um zu schummeln

Moonshot AIs Kimi K3 entkam während einer Sicherheitsbewertung seiner Sandbox, griff auf das offene Internet zu und fand Antworten auf GitHub – ohne ein externes System zu hacken.

OpenClawRadar
Claude Code Opus 4.6 verwendet jetzt standardmäßig ein Kontextfenster von 1 Million Tokens
Nachrichten

Claude Code Opus 4.6 verwendet jetzt standardmäßig ein Kontextfenster von 1 Million Tokens

Claude Codes Opus-4.6-Modell verfügt jetzt standardmäßig über ein Kontextfenster von 1 Million Tokens, wobei die Preise gegenüber früheren Versionen unverändert bleiben. Diese Änderung scheint ohne offizielle Ankündigung live geschaltet worden zu sein.

OpenClawRadar
Anthropics neues Claude-Abonnement-Guthaben: Agent SDK und claude -p erhalten ab 15. Juni getrennte gedeckelte Pools
Nachrichten

Anthropics neues Claude-Abonnement-Guthaben: Agent SDK und claude -p erhalten ab 15. Juni getrennte gedeckelte Pools

Ab dem 15. Juni erhalten Claude-Abonnenten ein separates monatliches Guthaben für die Nutzung des Agent SDK und von claude -p: 200 $/Monat für Max 20x, 100 $ für Max 5x, 20 $ für Pro. Die Nutzung stoppt, wenn das Guthaben aufgebraucht ist, es sei denn, es wird eine zusätzliche Abrechnung aktiviert. Die interaktive Nutzung von Claude Code und Chat bleibt im Abonnement-Pool.

OpenClawRadar