RLVRが小型のファインチューニングモデルを支援する場合:12データセットによる分析

最近の実験では、小規模言語モデル(1.7Bパラメータ)の教師ありファインチューニング(SFT)に強化学習段階(RLVR)を追加することで、測定可能なメリットが得られるかどうかが検証されました。研究チームは、このアプローチが有効な場合とそうでない場合を正確に特定するため、12のデータセットで制御実験を実施しました。
主な発見
結果はタスクタイプによって明確に分かれました:
- テキスト生成タスク(QA、ドキュメンテーション、PII編集):平均+2.0パーセントポイントの向上。このカテゴリのすべてのデータセットで改善が見られました。
- 構造化タスク(分類、関数呼び出し):平均-0.7パーセントポイントの低下。このカテゴリの2つのデータセットでは実際に後退しました。
このパターンが生じる理由
研究者らは、ファインチューニング済みモデルが既にほとんどの構造化出力を正しく生成できるようになると、GRPO(グループ相対ポリシー最適化)がほぼゼロの勾配を生成すると説明しています。基本的に、強化学習段階が活用できる学習シグナルが残っていないのです。
生成タスクの場合、出力空間が十分に広いため、RLはSFTが見逃していた改善点を引き続き発見できます——特に、厳密な文字列マッチングではなく意味的正しさを報酬とする場合に顕著です。
実践的な判断基準
この研究は開発者向けにシンプルなガイドラインを提供しています:
- 分類または厳密な関数呼び出し → SFTのみを使用
- QA、ドキュメンテーション、抽出タスク → SFTにRLVRを追加
方法論、テストされた全12のデータセット、および生データは完全な分析で公開されています。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also
OpenClaw 2026.9.6がClaude Opus 5.5、GPT-6 SolとLuna、Grok 4.7、および再起動リカバリを追加
OpenClaw 2026.9.6は351名のコントリビューターによる2,614件のPRを含んでリリースされ、Claude Opus 5.5、GPT-6 SolとLuna、Grok 4.7モデル、未完了の会話の再起動後の復元、30日間の利用レポート、ライブ議事録機能を追加します。

AIモデルが数学研究と証明発見を加速
AIモデルは現在、数学者が新しい結果を発見し証明するために使用されており、以前は数週間から数ヶ月かかっていた作業を1日で達成しています。2025年7月には、複数のAIモデルが国際数学オリンピックの6問中5問を解きました。
Google AIモード、検索より21.6%高い商品を表示
23日間の調査で200万以上のリストを追跡:同じ商品がAIモードと従来の検索の両方に表示される場合、AIモードの価格は平均21.6%高い。重複する商品はわずか1.28%。

英国内務省、AIが幻覚で作成した文書を根拠に亡命申請を却下、裁判官が認定
英国の上級裁判所判事は、内務省が難民申請を却下するために、AIが作り出した架空の証拠(存在しない国の政策ノート)を利用した可能性が高いと判断した。この欠落した文書は見つからず、判事はこの行為を「偽の証拠に依存するのに類似する」と評した。