シンプルな自己蒸留法がLLMのコード生成を改善

シンプルな自己蒸留の効果
シンプルな自己蒸留(SSD)は、大規模言語モデルから特定の温度設定と切り捨て設定で解決策をサンプリングし、それらのサンプルを標準的な教師ありファインチューニングでモデルに学習させるポストトレーニング手法です。重要な洞察は、検証器、教師モデル、強化学習を必要とせずに機能することです。
性能向上
Qwen3-30B-Instructでは、SSDによりLiveCodeBench v6におけるpass@1性能が42.4%から55.3%に向上しました。改善は難しい問題に集中しており、この手法はQwenとLlamaモデルの4B、8B、30Bスケール、命令型と思考型の両方のバリエーションで汎用的に適用されました。
なぜ機能するのか
研究者らは、この向上をLLMデコーディングにおける精度と探索の矛盾に起因すると分析しました。SSDは文脈依存の方法でトークン分布を再形成し、精度が重要な場合の注意散漫な「テール」を抑制しながら、探索が重要な場合の有用な多様性を保持します。これにより、正確なコードを生成することと異なる解決アプローチを探索することの根本的な緊張関係に対処します。
実用的な意義
SSDは、検証器や強化学習を必要とする手法と比較して実装が比較的簡単な、LLMコード生成を改善する補完的なポストトレーニングの方向性を提供します。このアプローチは既存のファインチューニングインフラで動作し、追加のモデルや複雑な報酬システムを必要としません。
📖 Read the full source: HN AI Agents
👀 See Also

ブリタニカ百科事典、AI学習データを巡りOpenAIを提訴
ブリタニカ百科事典は、AI学習データに関連する著作権侵害を主張してOpenAIを提訴しました。この訴訟は2026年3月16日にロイターによって報道され、Hacker Newsで議論を呼んでいます。

15のマルチモーダルAIモデルの視覚的推論ベンチマーク結果
AIMultipleは、2つのトラック(チャート理解と視覚的論理)にわたる200の視覚的推論問題で、主要な15のマルチモーダルAIモデルをベンチマークしました。Gemini-3.1-pro-previewとGemini-3-pro-previewが総合結果をリードし、続いてGPT-5.2、Kimi-K2.5、GPT-5.2-proが続きました。

開発者、8GB VRAMでのEmbed、Rerank、およびZero-Shotモデルの提供に関するアーキテクチャのアドバイスを求める
ローカルコーディングエージェント向けの統合ナレッジグラフ/RAGサービスを構築している開発者が、8GB VRAMと16GBシステムRAMのメモリ制約に苦しんでおり、3つのトランスフォーマーモデルを同時に提供する際にOOMエラー、レイテンシースパイク、Linuxカーネルによる強制終了が発生しています。

Autonomaの18か月にわたるコードベース書き換え:テスト、技術的負債、サーバーアクションに関する教訓
Autonomaは、エンジニアを2人から14人に拡大した後、1.5年分のコードを破棄しました。その理由として、テストの欠如、厳格でないTypeScriptの使用、およびServer Actionsの制限を挙げ、これらが書き直しの主な要因であると説明しています。