Unsloth와 NVIDIA 협력, LLM 훈련 속도 약 25% 향상

Unsloth와 NVIDIA의 협업으로 세 가지 핵심 최적화를 구현하여 ~25%의 학습 속도 향상(정확도 손실 없음)을 달성했습니다: 패킹된 시퀀스 메타데이터 캐싱, 이중 버퍼 비동기 그래디언트 체크포인팅, MoE 라우팅 개선. 이러한 최적화는 Unsloth 업데이트와 함께 RTX 노트북, 데이터센터 GPU, DGX Spark에서 자동 활성화됩니다.
패킹된 시퀀스 메타데이터 캐싱
패킹 트레이닝은 짧은 예제를 연결하여 패딩 낭비를 방지합니다. 이전에는 각 트랜스포머 레이어가 동일한 시퀀스 메타데이터(길이, cu_seqlens, max_seqlen, 마스크 구조)를 매번 처음부터 재구성하여 디바이스-호스트 동기화 오버헤드가 발생했습니다. Unsloth는 메타데이터를 배치당 한 번 캐싱하고 레이어 전체에서 재사용하여 반복 작업을 줄입니다.
Qwen3-14B QLoRA SFT 벤치마크 결과:
- 순전파: +43.3% 더 빠름
- 역전파: +5.8% 더 빠름
- 배치당 전체: +14.3% 더 빠름
NVIDIA Blackwell GPU에서의 마이크로벤치마크에서는 주요 마스크 구성 비용이 패킹된 배치당 약 13.7ms로 측정되었습니다. Llama-3.2-1B(16레이어)의 경우 단계당 약 199ms 절약(11.5% 감소), Qwen3-0.6B(28레이어)의 경우 약 319ms 절약(14.8% 감소)됩니다.
이중 버퍼 비동기 그래디언트 체크포인팅
비동기 그래디언트 체크포인팅은 재계산과 계산을 중첩시킵니다. 정확도에 영향을 주지 않으면서 8%의 속도 향상을 제공합니다.
MoE 라우팅: argsort + bincount
MoE 모델의 경우, 커스텀 커널 대신 torch.argsort와 torch.bincount를 사용하면 gpt-oss 학습 속도가 15% 향상됩니다.
모든 최적화는 지원 하드웨어에서 자동 활성화됩니다. Unsloth를 업데이트하여 적용하세요.
📖 전체 소스 읽기: HN LLM Tools
👀 See Also

일 처리하기: AI 코딩 에이전트를 위한 메타 프롬프팅 시스템
Get Shit Done(GSD)는 메타 프롬프팅, 컨텍스트 엔지니어링, 스펙 기반 개발 시스템으로 Claude Code, OpenCode, Gemini CLI, Codex, Copilot, Antigravity와 함께 작동합니다. 구조화된 프롬프트와 검증 워크플로우를 제공하여 컨텍스트 부패 문제를 해결합니다.

Zeude: Claude Code와 OpenAI Codex를 위한 자체 호스팅 모니터링 대시보드
Zeude는 Claude Code와 OpenAI Codex 사용량을 추적하는 자체 호스팅 대시보드로, 프롬프트별 토큰 및 비용 분석, 주간 리더보드, 팀 스킬 관리를 제공합니다. 버전 1.0.0에서는 Windows 지원, Codex 통합, 사용자별 스킬 옵트아웃 기능이 추가되었습니다.

클로드 코드용 디자인 스튜디오 플러그인, 9가지 역할과 16개 명령어로 구성된 가상 디자인 팀 추가
Design Studio라는 새로운 Claude Code 플러그인은 9개의 전문가 역할, 16개의 슬래시 명령어, 5개의 에이전트로 구성된 완전한 디자인 팀을 시뮬레이션합니다. 기술 스택을 자동으로 감지하며 참조 파일에 걸쳐 8,000줄 이상의 디자인 지식을 포함합니다.

Bifrost LLM 게이트웨이: 11마이크로초 오버헤드, Go로 작성된 단일 바이너리
Bifrost는 Go로 작성된 오픈소스 LLM 프록시로, OpenAI, Anthropic, Azure, Bedrock으로 요청을 라우팅하며 요청당 11마이크로초의 오버헤드와 월 20달러 VPS에서 5,000 RPS를 처리합니다.