Unsloth und NVIDIA arbeiten zusammen, um das LLM-Training um etwa 25 % zu beschleunigen

Die Zusammenarbeit von Unsloth mit NVIDIA führt zu einer ~25%igen Trainingsbeschleunigung (ohne Genauigkeitsverlust) durch die Implementierung von drei wichtigen Optimierungen: Caching von Metadaten gepackter Sequenzen, doppelt gepuffertes asynchrones Gradienten-Checkpointing und Verbesserungen beim MoE-Routing. Diese werden mit einem Unsloth-Update automatisch auf RTX-Laptops, Data-Center-GPUs und DGX Spark aktiviert.
Caching von Metadaten gepackter Sequenzen
Gepacktes Training verkettet kurze Beispiele, um Padding-Verschwendung zu vermeiden. Bisher hat jede Transformator-Schicht dieselben Sequenzmetadaten (Längen, cu_seqlens, max_seqlen, Maskenstruktur) von Grund auf neu aufgebaut, was zu Synchronisations-Overhead zwischen Gerät und Host führte. Indem die Metadaten einmal pro Batch zwischengespeichert und über Schichten hinweg wiederverwendet werden, reduziert Unsloth wiederholte Arbeit.
Benchmarks mit Qwen3-14B QLoRA SFT zeigen:
- Vorwärtspass: +43,3% schneller
- Rückwärtspass: +5,8% schneller
- Insgesamt pro Batch: +14,3% schneller
Ein Mikrobenchmark auf NVIDIA Blackwell GPUs maß die dominante Maskenkonstruktionskosten mit ~13,7 ms pro gepacktem Batch. Für Llama-3.2-1B (16 Schichten) bedeutet dies ~199 ms Einsparung pro Schritt (11,5% weniger); für Qwen3-0.6B (28 Schichten) ~319 ms Einsparung (14,8% weniger).
Doppelt gepuffertes asynchrones Gradienten-Checkpointing
Asynchrones Gradienten-Checkpointing überlappt die Neuberechnung mit der Berechnung. Dies ergibt eine 8%ige Beschleunigung ohne Beeinträchtigung der Genauigkeit.
MoE-Routing: argsort + bincount
Für MoE-Modelle beschleunigt die Verwendung von torch.argsort und torch.bincount anstelle benutzerdefinierter Kernel das gpt-oss-Training um 15%.
Alle Optimierungen werden auf unterstützter Hardware automatisch aktiviert. Aktualisieren Sie Unsloth, um sie zu erhalten.
📖 Lesen Sie die vollständige Quelle: HN LLM Tools
👀 Siehe auch

Crispy VS Code-Erweiterung fügt Agentenspeicher und Multi-Agent-Funktionen für Claude und Codex hinzu
Crispy ist eine Open-Source-VS-Code-Erweiterung, die die Claude Code- und Codex-CLIs mit einer GUI umhüllt und lokalen Agentenspeicher mit semantischer Suche, Multi-Agenten-Sitzungen, Konversationsverzweigung und dedizierten Werkzeugansichten hinzufügt. Sie läuft unter Linux, macOS und Windows unter MIT-Lizenz.

Ein-Befehl-Docker-Setup für OpenClaw mit Vollverschlüsselung und Überwachung
Ein Docker-Setup für OpenClaw, das Anleitungen zur Vollverschlüsselung bietet, Tini als PID 1 nutzt, integrierte Überwachungstools enthält und Daten als Klartextdateien auf dem Host speichert. Die Bereitstellung erfordert nur zwei Befehle: git clone und ./shell.

BottyFans: Offene API fuer KI-Agenten-Monetarisierung mit USDC
Eine neue Plattform ermoeglicht KI-Agenten eigene Creator-Geschaefte mit Abonnements, Trinkgeldern und bezahlten Inhalten in USDC.

DebugBase: Eine gemeinsame Wissensdatenbank für Fehler bei KI-Codierungsagenten über MCP
DebugBase ist ein MCP-kompatibles Tool, das eine gemeinsame Wissensdatenbank bereitstellt, in der KI-Coding-Agenten nach bekannten Lösungen für häufige Fehler wie Next.js-Hydratisierungsfehler oder TypeScript-Auflösungsprobleme suchen können. Es enthält 11 MCP-Tools und ist bereits mit 58 Fehler/Lösungs-Paaren aus echten Agenten-Sitzungen vorbelegt.