UnslothとNVIDIA、LLMトレーニングを約25%高速化するために協力

UnslothとNVIDIAの協業により、3つの主要な最適化を実装することで、トレーニングが約25%高速化(精度低下なし)しました。具体的には、パックシーケンスメタデータのキャッシュ、ダブルバッファ非同期勾配チェックポインティング、およびMoEルーティングの改善です。これらはUnslothのアップデートにより、RTXノートPC、データセンターGPU、DGX Sparkで自動有効化されます。
パックシーケンスメタデータのキャッシュ
パックトレーニングは短いサンプルを連結してパディングの無駄を避けます。従来、各トランスフォーマー層は同じシーケンスメタデータ(長さ、cu_seqlens、max_seqlen、マスク構造)を毎回ゼロから再構築しており、デバイス-ホスト間の同期オーバーヘッドが発生していました。Unslothはメタデータをバッチごとに一度キャッシュし、各層で再利用することで、繰り返しの作業を削減します。
Qwen3-14B QLoRA SFTでのベンチマーク結果:
- 順伝播:43.3%高速化
- 逆伝播:5.8%高速化
- バッチ全体:14.3%高速化
NVIDIA Blackwell GPUでのマイクロベンチマークでは、支配的なマスク構築コストがパックバッチあたり約13.7ミリ秒と測定されました。Llama-3.2-1B(16層)では、ステップあたり約199ミリ秒(11.5%削減)、Qwen3-0.6B(28層)では約319ミリ秒(14.8%削減)の節約になります。
ダブルバッファ非同期勾配チェックポインティング
非同期勾配チェックポインティングは再計算を計算とオーバーラップさせます。これにより、精度に影響を与えずに8%の高速化を実現します。
MoEルーティング:argsort + bincount
MoEモデルでは、カスタムカーネルの代わりにtorch.argsortとtorch.bincountを使用することで、gpt-ossトレーニングが15%高速化されます。
すべての最適化はサポート対象ハードウェアで自動有効化されます。Unslothをアップデートしてご利用ください。
📖 出典全文: HN LLM Tools
👀 See Also

自律的なコーディングワークフローが、Claude Codeを使用して一晩で16万3千行を出荷
ある開発者が、一晩で72のタスクを完了し、163,643行のコードを生成し、6,400以上のテストをパスさせ、初回試行成功率85%を達成した自律ワークフローを構築しました。

9つのビルディングブロック:18事業にわたってクロード・コードを永続的なOSとして実行する方法
1人の開発者が18個のClaude Codeインスタンスを共有OSとして運用し、選択的同期、状態のMCPサーバーへの移行、レシートベースの検証、ルールの自動読み込みを実装。アーキテクチャの詳細を解説。

Mneme: 永続的なメモリを備えたフリーのローカルファーストClaudeチャットクライアント
Mnemeは、階層型メモリ、エンティティ追跡、日次サマリーを備え、Anthropic API経由でSonnet 4.5をサポートする、無料のオープンソース、ローカルファーストのClaudeチャットクライアントです。

Claude向けの法的MCPサーバーが400万件以上の米国裁判所判例にアクセスを提供
Claude Codeで構築された無料のオープンソースMCPサーバーは、Claude AIに400万件以上の実在する米国裁判所の判例へのアクセスを提供し、判例法検索、引用追跡、Bluebook解析、Clio実務管理、PACER連邦書類へのアクセスなど18のツールを備え、幻覚(hallucination)なしで利用できます。