シンプルな自己蒸留法がLLMのコード生成を改善

シンプルな自己蒸留の効果
シンプルな自己蒸留(SSD)は、大規模言語モデルから特定の温度設定と切り捨て設定で解決策をサンプリングし、それらのサンプルを標準的な教師ありファインチューニングでモデルに学習させるポストトレーニング手法です。重要な洞察は、検証器、教師モデル、強化学習を必要とせずに機能することです。
性能向上
Qwen3-30B-Instructでは、SSDによりLiveCodeBench v6におけるpass@1性能が42.4%から55.3%に向上しました。改善は難しい問題に集中しており、この手法はQwenとLlamaモデルの4B、8B、30Bスケール、命令型と思考型の両方のバリエーションで汎用的に適用されました。
なぜ機能するのか
研究者らは、この向上をLLMデコーディングにおける精度と探索の矛盾に起因すると分析しました。SSDは文脈依存の方法でトークン分布を再形成し、精度が重要な場合の注意散漫な「テール」を抑制しながら、探索が重要な場合の有用な多様性を保持します。これにより、正確なコードを生成することと異なる解決アプローチを探索することの根本的な緊張関係に対処します。
実用的な意義
SSDは、検証器や強化学習を必要とする手法と比較して実装が比較的簡単な、LLMコード生成を改善する補完的なポストトレーニングの方向性を提供します。このアプローチは既存のファインチューニングインフラで動作し、追加のモデルや複雑な報酬システムを必要としません。
📖 Read the full source: HN AI Agents
👀 See Also

Claude Code v2.1.149: 使用状況の内訳、権限修正、キーボードナビゲーション
Claude Code v2.1.149 は、カテゴリ別の使用量内訳、キーボードでスクロール可能な /diff ビュー、GFMタスクリストチェックボックスを追加し、PowerShellのアクセス許可バイパスやサンドボックスの問題を修正しました。

Claude Codeは単なるAIコードチャットからエンジニアリングOSへと進化中
Redditの議論では、Claude CodeはコーディングのためのAIチャットというよりも、計画、コードレビュー、クラウドエージェント、自律的なワークフローを備えたエンジニアリングオペレーティングシステムに近づいていると主張されています。

ChatGPT Workspace Agents 無料プレビュー本日終了 — OpenClaw と Hermes との比較
OpenAIのChatGPT Workspace Agentsの無料プレビューが5月6日に終了し、クレジット制の料金体系に移行します。Redditの投稿では、これをOpenClawやHermes、BetterClawのようなマネージドプラットフォームと比較し、チーム利用と個人利用の違いを論じています。

AlphaEvolve:DeepMindのGemini搭載エージェントがゲノミクス、電力網、TPC回路にわたるアルゴリズムを最適化する
Google DeepMindが開発したGemini搭載のコーディングエージェント「AlphaEvolve」により、DeepConsensusのバリアント検出エラーが30%改善、AC Optimal Power FlowのGNN実行可能性が14%から88%に向上、量子回路エラーが10分の1に削減されました。