Unsloth und NVIDIA arbeiten zusammen, um das LLM-Training um etwa 25 % zu beschleunigen

Die Zusammenarbeit von Unsloth mit NVIDIA führt zu einer ~25%igen Trainingsbeschleunigung (ohne Genauigkeitsverlust) durch die Implementierung von drei wichtigen Optimierungen: Caching von Metadaten gepackter Sequenzen, doppelt gepuffertes asynchrones Gradienten-Checkpointing und Verbesserungen beim MoE-Routing. Diese werden mit einem Unsloth-Update automatisch auf RTX-Laptops, Data-Center-GPUs und DGX Spark aktiviert.
Caching von Metadaten gepackter Sequenzen
Gepacktes Training verkettet kurze Beispiele, um Padding-Verschwendung zu vermeiden. Bisher hat jede Transformator-Schicht dieselben Sequenzmetadaten (Längen, cu_seqlens, max_seqlen, Maskenstruktur) von Grund auf neu aufgebaut, was zu Synchronisations-Overhead zwischen Gerät und Host führte. Indem die Metadaten einmal pro Batch zwischengespeichert und über Schichten hinweg wiederverwendet werden, reduziert Unsloth wiederholte Arbeit.
Benchmarks mit Qwen3-14B QLoRA SFT zeigen:
- Vorwärtspass: +43,3% schneller
- Rückwärtspass: +5,8% schneller
- Insgesamt pro Batch: +14,3% schneller
Ein Mikrobenchmark auf NVIDIA Blackwell GPUs maß die dominante Maskenkonstruktionskosten mit ~13,7 ms pro gepacktem Batch. Für Llama-3.2-1B (16 Schichten) bedeutet dies ~199 ms Einsparung pro Schritt (11,5% weniger); für Qwen3-0.6B (28 Schichten) ~319 ms Einsparung (14,8% weniger).
Doppelt gepuffertes asynchrones Gradienten-Checkpointing
Asynchrones Gradienten-Checkpointing überlappt die Neuberechnung mit der Berechnung. Dies ergibt eine 8%ige Beschleunigung ohne Beeinträchtigung der Genauigkeit.
MoE-Routing: argsort + bincount
Für MoE-Modelle beschleunigt die Verwendung von torch.argsort und torch.bincount anstelle benutzerdefinierter Kernel das gpt-oss-Training um 15%.
Alle Optimierungen werden auf unterstützter Hardware automatisch aktiviert. Aktualisieren Sie Unsloth, um sie zu erhalten.
📖 Lesen Sie die vollständige Quelle: HN LLM Tools
👀 Siehe auch

Das Depct-Tool sammelt Laufzeitdaten, um Claude bei der Fehlerbehebung von Produktionsproblemen zu unterstützen.
Depct ist ein Tool, das Laufzeitinstrumentierungsdaten von Node.js-Anwendungen sammelt, daraus Graphen erstellt und diese über AWS Bedrock an Claude weiterleitet, um bei der Fehlersuche bei sporadischen Produktionsfehlern zu helfen. Es generiert auch Architekturdiagramme und Abhängigkeitskarten aus dem Laufzeitverhalten.

Tinte: Eine Bereitstellungsplattform, bei der Claude-KI-Agenten die Hauptnutzer sind
Ink (ml.ink) ist eine Bereitstellungsplattform, die für KI-Agenten wie Claude entwickelt wurde und eine einzige Tool-Aufruf-Bereitstellung, automatische Framework-Erkennung sowie integrierte Dienste wie Rechenleistung, Datenbanken, DNS, Geheimnisse, Domains, Metriken und Protokolle bietet.

Swarm Orchestra v2-Plugin fügt Inter-Agenten-Nachrichtenübertragung hinzu, um das Chaos im Claude-Code-Agenten-Team zu beheben
Swarm Orchestra ist ein Plugin, das sich mit der experimentellen TeamCreate-Funktion von Claude Code befasst, die außer Kontrolle geratene Agenten erzeugen kann. Version 2 fügt Nachrichtenübermittlung zwischen Agenten über einen PreToolUse-Hook und Selbstkonfiguration über eine /teammate-Fähigkeit hinzu.

InsForge: Eine Backend-Semantikschicht für Claude Code Agents
InsForge stellt sechs Backend-Primitive bereit – Authentifizierung, Postgres-Datenbank, S3-kompatiblen Speicher, Edge-/Serverless-Funktionen, Model-Gateway und Site-Deployment – als strukturierte Komponenten dar, die Claude Code-Agenten über MCP inspizieren und konfigurieren können, anstatt API-Integrationen erraten zu müssen.