3ドルとゼロの人間ラベラーでClaude Haikuの96%まで微調整したQwen2.5-7B

ある開発者がQwen2.5-7Bを微調整し、ドメイン固有の意思決定タスクでClaude Haikuの複合性能の96%を達成した。API呼び出し費用はわずか約3ドルで、人間のラベラーはゼロ。この手法はDV-DPO(Decision-Validated Direct Preference Optimization)と呼ばれ、複数の声を持つ敵対的協議会を実行することで自律的に学習信号を生成する。
DV-DPOの仕組み
パイプラインは各決定質問に対して3つの声の協議会を実行し、統合結果を生成する。その後、負けた2つの声が統合結果を反駁する。もしこの敵対的プレッシャーの下で統合結果が修正された場合、DPOペアが形成される:修正後のバージョンが選択応答、修正前のバージョンが拒否応答となる。統合結果が維持された場合はペアは作成されない。これにより、形式の好みやサンプリングのばらつきではなく、真の推論エラーのみが学習信号を生成する。
結果
- 1,040個のトレーニングペアを生成(Haikuレートで約3ドル)
- Claude Haikuとの直接対決:形式100%、コミット100%、コンテキスト89%、複合96%
- レイテンシ:T4 GPU(4ビット量子化)で11秒、Haikuは3秒
- 敵対的失敗率:96の標的問題に対して2%
自律的改善ループ
システムは現在、自動サイクルを実行中:失敗検出器 → 自動レッドチーム → DPOペア → 再トレーニング → 再デプロイ → 評価。バージョン5のペアが蓄積中。微調整済みモデルはGGUFファイルとして提供され、Ollamaで利用可能。
こんな人におすすめ
ドメイン固有の推論エージェントを構築し、従量課金APIから高価な人間によるアノテーションなしでローカルの微調整モデルに移行したい開発者向け。
📖 出典全文: r/LocalLLaMA
👀 See Also

Claude Code v2.1.83では、管理設定フラグメント、トランスクリプト検索、およびセキュリティ改善が追加されました。
Claude Code v2.1.83では、チームポリシーフラグメント用のmanaged-settings.d/ディレクトリ、/とn/Nナビゲーションによるトランスクリプト検索、サブプロセス環境から認証情報を除去するCLAUDE_CODE_SUBPROCESS_ENV_SCRUB=1が導入されました。また、CwdChanged/FileChangedフック、sandbox.failIfUnavailable設定、macOSでの終了ハング、UIフリーズ、メモリリークの修正も含まれています。

Claude-Code v2.1.110は、TUIモード、プッシュ通知、および複数の修正を追加しました。
Claude-Code v2.1.110では、ちらつきのないレンダリングのための新しい/tuiコマンド、モバイルアラートのためのプッシュ通知機能、プラグイン管理とリモートコントロール機能の改善が導入されました。このリリースには、MCPサーバー、セッション処理、UI問題に関する多数のバグ修正も含まれています。

AIサブスクリプション価格の暴落:あなたの企業請求額が10倍になる理由
OpenAI、Anthropic、MicrosoftなどのAIラボは、すべてのサブスクリプションシートで赤字を出している。エージェント型ワークロードが定額制モデルを破綻させ、GitHub Copilotは2026年6月1日から従量課金制に移行する。補助金価格で構築したエンタープライズ企業は、価格修正に直面する。

OpenClawが初のAMAを開催:AIコーディングエージェントに関する洞察
AIコーディングエージェントの分野で注目を集めるOpenClawが、Redditで初のAMA(何でも聞いてください)セッションを開催しました。この議論では、その影響力、将来の計画、そして課題について明らかになりました。