3ドルとゼロの人間ラベラーでClaude Haikuの96%まで微調整したQwen2.5-7B

ある開発者がQwen2.5-7Bを微調整し、ドメイン固有の意思決定タスクでClaude Haikuの複合性能の96%を達成した。API呼び出し費用はわずか約3ドルで、人間のラベラーはゼロ。この手法はDV-DPO(Decision-Validated Direct Preference Optimization)と呼ばれ、複数の声を持つ敵対的協議会を実行することで自律的に学習信号を生成する。
DV-DPOの仕組み
パイプラインは各決定質問に対して3つの声の協議会を実行し、統合結果を生成する。その後、負けた2つの声が統合結果を反駁する。もしこの敵対的プレッシャーの下で統合結果が修正された場合、DPOペアが形成される:修正後のバージョンが選択応答、修正前のバージョンが拒否応答となる。統合結果が維持された場合はペアは作成されない。これにより、形式の好みやサンプリングのばらつきではなく、真の推論エラーのみが学習信号を生成する。
結果
- 1,040個のトレーニングペアを生成(Haikuレートで約3ドル)
- Claude Haikuとの直接対決:形式100%、コミット100%、コンテキスト89%、複合96%
- レイテンシ:T4 GPU(4ビット量子化)で11秒、Haikuは3秒
- 敵対的失敗率:96の標的問題に対して2%
自律的改善ループ
システムは現在、自動サイクルを実行中:失敗検出器 → 自動レッドチーム → DPOペア → 再トレーニング → 再デプロイ → 評価。バージョン5のペアが蓄積中。微調整済みモデルはGGUFファイルとして提供され、Ollamaで利用可能。
こんな人におすすめ
ドメイン固有の推論エージェントを構築し、従量課金APIから高価な人間によるアノテーションなしでローカルの微調整モデルに移行したい開発者向け。
📖 出典全文: r/LocalLLaMA
👀 See Also

非営利団体がチームおよびエンタープライズプランでClaude Opus 4.6にアクセス可能に
チームおよびエンタープライズプランを利用している非営利団体は、Anthropicの最新AIモデル「Claude Opus 4.6」に追加費用なしでアクセスできるようになりました。

AnthropicがClaude Codeのレート制限を倍増、SpaceXとコンピュート契約を締結
Claude Codeの5時間レート制限がPro/Max/Team/Enterpriseプランで2倍に拡大、ピーク時の引き下げが廃止され、OpusモデルのAPIレート制限が引き上げられました。SpaceX Colossus 1が1ヶ月以内に300MW以上の容量(22万基のNVIDIA GPU)を追加。

「Tokenmaxxingは新しいストップウォッチ:AIポリシーに一貫性が必要な理由」
ブライアン・ミーカー氏は、トークンマキシングのような虚栄の指標に反論し、自身のチームの4つのポイントからなるAIポリシーを共有している:強制しない、生成されたコードを理解する、AIツールなしでも仕事ができる、チームメイトと顧客を大切にする。

Claude Code v2.1.147:ピン留めセッション、/code-review、および数十の修正
Claude Code v2.1.147 では、ピン留めされたバックグラウンドセッションの導入、/simplify を /code-review に名称変更(努力レベルと --comment を追加)、PowerShell、MCP、Windows などの修正を実施。