UnslothとNVIDIA、LLMトレーニングを約25%高速化するために協力

✍️ OpenClawRadar📅 公開日: May 7, 2026🔗 Source
UnslothとNVIDIA、LLMトレーニングを約25%高速化するために協力
Ad

UnslothとNVIDIAの協業により、3つの主要な最適化を実装することで、トレーニングが約25%高速化(精度低下なし)しました。具体的には、パックシーケンスメタデータのキャッシュ、ダブルバッファ非同期勾配チェックポインティング、およびMoEルーティングの改善です。これらはUnslothのアップデートにより、RTXノートPC、データセンターGPU、DGX Sparkで自動有効化されます。

パックシーケンスメタデータのキャッシュ

パックトレーニングは短いサンプルを連結してパディングの無駄を避けます。従来、各トランスフォーマー層は同じシーケンスメタデータ(長さ、cu_seqlens、max_seqlen、マスク構造)を毎回ゼロから再構築しており、デバイス-ホスト間の同期オーバーヘッドが発生していました。Unslothはメタデータをバッチごとに一度キャッシュし、各層で再利用することで、繰り返しの作業を削減します。

Qwen3-14B QLoRA SFTでのベンチマーク結果:

  • 順伝播:43.3%高速化
  • 逆伝播:5.8%高速化
  • バッチ全体:14.3%高速化

NVIDIA Blackwell GPUでのマイクロベンチマークでは、支配的なマスク構築コストがパックバッチあたり約13.7ミリ秒と測定されました。Llama-3.2-1B(16層)では、ステップあたり約199ミリ秒(11.5%削減)、Qwen3-0.6B(28層)では約319ミリ秒(14.8%削減)の節約になります。

ダブルバッファ非同期勾配チェックポインティング

非同期勾配チェックポインティングは再計算を計算とオーバーラップさせます。これにより、精度に影響を与えずに8%の高速化を実現します。

MoEルーティング:argsort + bincount

MoEモデルでは、カスタムカーネルの代わりにtorch.argsortとtorch.bincountを使用することで、gpt-ossトレーニングが15%高速化されます。

すべての最適化はサポート対象ハードウェアで自動有効化されます。Unslothをアップデートしてご利用ください。

📖 出典全文: HN LLM Tools

Ad

👀 See Also

自律的なコーディングワークフローが、Claude Codeを使用して一晩で16万3千行を出荷
Tools

自律的なコーディングワークフローが、Claude Codeを使用して一晩で16万3千行を出荷

ある開発者が、一晩で72のタスクを完了し、163,643行のコードを生成し、6,400以上のテストをパスさせ、初回試行成功率85%を達成した自律ワークフローを構築しました。

OpenClawRadar
9つのビルディングブロック:18事業にわたってクロード・コードを永続的なOSとして実行する方法
Tools

9つのビルディングブロック:18事業にわたってクロード・コードを永続的なOSとして実行する方法

1人の開発者が18個のClaude Codeインスタンスを共有OSとして運用し、選択的同期、状態のMCPサーバーへの移行、レシートベースの検証、ルールの自動読み込みを実装。アーキテクチャの詳細を解説。

OpenClawRadar
Mneme: 永続的なメモリを備えたフリーのローカルファーストClaudeチャットクライアント
Tools

Mneme: 永続的なメモリを備えたフリーのローカルファーストClaudeチャットクライアント

Mnemeは、階層型メモリ、エンティティ追跡、日次サマリーを備え、Anthropic API経由でSonnet 4.5をサポートする、無料のオープンソース、ローカルファーストのClaudeチャットクライアントです。

OpenClawRadar
Claude向けの法的MCPサーバーが400万件以上の米国裁判所判例にアクセスを提供
Tools

Claude向けの法的MCPサーバーが400万件以上の米国裁判所判例にアクセスを提供

Claude Codeで構築された無料のオープンソースMCPサーバーは、Claude AIに400万件以上の実在する米国裁判所の判例へのアクセスを提供し、判例法検索、引用追跡、Bluebook解析、Clio実務管理、PACER連邦書類へのアクセスなど18のツールを備え、幻覚(hallucination)なしで利用できます。

OpenClawRadar