UnslothとNVIDIA、LLMトレーニングを約25%高速化するために協力

UnslothとNVIDIAの協業により、3つの主要な最適化を実装することで、トレーニングが約25%高速化(精度低下なし)しました。具体的には、パックシーケンスメタデータのキャッシュ、ダブルバッファ非同期勾配チェックポインティング、およびMoEルーティングの改善です。これらはUnslothのアップデートにより、RTXノートPC、データセンターGPU、DGX Sparkで自動有効化されます。
パックシーケンスメタデータのキャッシュ
パックトレーニングは短いサンプルを連結してパディングの無駄を避けます。従来、各トランスフォーマー層は同じシーケンスメタデータ(長さ、cu_seqlens、max_seqlen、マスク構造)を毎回ゼロから再構築しており、デバイス-ホスト間の同期オーバーヘッドが発生していました。Unslothはメタデータをバッチごとに一度キャッシュし、各層で再利用することで、繰り返しの作業を削減します。
Qwen3-14B QLoRA SFTでのベンチマーク結果:
- 順伝播:43.3%高速化
- 逆伝播:5.8%高速化
- バッチ全体:14.3%高速化
NVIDIA Blackwell GPUでのマイクロベンチマークでは、支配的なマスク構築コストがパックバッチあたり約13.7ミリ秒と測定されました。Llama-3.2-1B(16層)では、ステップあたり約199ミリ秒(11.5%削減)、Qwen3-0.6B(28層)では約319ミリ秒(14.8%削減)の節約になります。
ダブルバッファ非同期勾配チェックポインティング
非同期勾配チェックポインティングは再計算を計算とオーバーラップさせます。これにより、精度に影響を与えずに8%の高速化を実現します。
MoEルーティング:argsort + bincount
MoEモデルでは、カスタムカーネルの代わりにtorch.argsortとtorch.bincountを使用することで、gpt-ossトレーニングが15%高速化されます。
すべての最適化はサポート対象ハードウェアで自動有効化されます。Unslothをアップデートしてご利用ください。
📖 出典全文: HN LLM Tools
👀 See Also

ログリデューサーMCPサーバーがClaudeコードのログ読み取り時のトークン使用量を削減
Log Reducerは、Claude Code向けに特別に構築されたMCPサーバーで、ログファイルをサーバー側で読み取り、会話には削減された出力のみを送信し、生のログがコンテキストウィンドウに入るのを防ぎます。開発者によると、2000行のログは、セッションから恒久的に削除される20,000以上のトークンを表しています。

AIコーディングエージェントのためのセキュリティスキャン機能は、デプロイメントを自動的にチェックします。
開発者が、AIコーディングエージェントがデプロイ後に自動的にセキュリティ問題をスキャンできるスキルファイルを作成しました。このスキャンは、公開された秘密情報、開かれたポート、欠落したセキュリティヘッダー、漏洩したソースコードなどを検出し、各デプロイ後に約30秒で実行されます。

uimax-mcp: Claude Codeによる自動フロントエンドコードレビューと修正のための無料MCPサーバー
uimax-mcpは、Claude Codeを使用してフロントエンドのコードレビューと修正を自動化する無料のMCPサーバーです。1つのコマンドで、スクリーンショットの撮影、Lighthouseとアクセシビリティ監査の実行、アンチパターンのスキャン、自動修正の生成を行います。

NerfGuard: コード要求をより安価なモデルにルーティングし、コストを3倍削減する分類器
NerfGuardは高速な分類器を使ってコーディングエージェントのリクエストを最も安価なモデルと推論深度にルーティングし、同じ支出で3倍の利用を実現します。トークン最適化も含まれています。