Unsloth und NVIDIA arbeiten zusammen, um das LLM-Training um etwa 25 % zu beschleunigen

✍️ OpenClawRadar📅 Veröffentlicht: 7. Mai 2026🔗 Source
Unsloth und NVIDIA arbeiten zusammen, um das LLM-Training um etwa 25 % zu beschleunigen
Ad

Die Zusammenarbeit von Unsloth mit NVIDIA führt zu einer ~25%igen Trainingsbeschleunigung (ohne Genauigkeitsverlust) durch die Implementierung von drei wichtigen Optimierungen: Caching von Metadaten gepackter Sequenzen, doppelt gepuffertes asynchrones Gradienten-Checkpointing und Verbesserungen beim MoE-Routing. Diese werden mit einem Unsloth-Update automatisch auf RTX-Laptops, Data-Center-GPUs und DGX Spark aktiviert.

Caching von Metadaten gepackter Sequenzen

Gepacktes Training verkettet kurze Beispiele, um Padding-Verschwendung zu vermeiden. Bisher hat jede Transformator-Schicht dieselben Sequenzmetadaten (Längen, cu_seqlens, max_seqlen, Maskenstruktur) von Grund auf neu aufgebaut, was zu Synchronisations-Overhead zwischen Gerät und Host führte. Indem die Metadaten einmal pro Batch zwischengespeichert und über Schichten hinweg wiederverwendet werden, reduziert Unsloth wiederholte Arbeit.

Benchmarks mit Qwen3-14B QLoRA SFT zeigen:

  • Vorwärtspass: +43,3% schneller
  • Rückwärtspass: +5,8% schneller
  • Insgesamt pro Batch: +14,3% schneller

Ein Mikrobenchmark auf NVIDIA Blackwell GPUs maß die dominante Maskenkonstruktionskosten mit ~13,7 ms pro gepacktem Batch. Für Llama-3.2-1B (16 Schichten) bedeutet dies ~199 ms Einsparung pro Schritt (11,5% weniger); für Qwen3-0.6B (28 Schichten) ~319 ms Einsparung (14,8% weniger).

Ad

Doppelt gepuffertes asynchrones Gradienten-Checkpointing

Asynchrones Gradienten-Checkpointing überlappt die Neuberechnung mit der Berechnung. Dies ergibt eine 8%ige Beschleunigung ohne Beeinträchtigung der Genauigkeit.

MoE-Routing: argsort + bincount

Für MoE-Modelle beschleunigt die Verwendung von torch.argsort und torch.bincount anstelle benutzerdefinierter Kernel das gpt-oss-Training um 15%.

Alle Optimierungen werden auf unterstützter Hardware automatisch aktiviert. Aktualisieren Sie Unsloth, um sie zu erhalten.

📖 Lesen Sie die vollständige Quelle: HN LLM Tools

Ad

👀 Siehe auch

Das Depct-Tool sammelt Laufzeitdaten, um Claude bei der Fehlerbehebung von Produktionsproblemen zu unterstützen.
Werkzeuge

Das Depct-Tool sammelt Laufzeitdaten, um Claude bei der Fehlerbehebung von Produktionsproblemen zu unterstützen.

Depct ist ein Tool, das Laufzeitinstrumentierungsdaten von Node.js-Anwendungen sammelt, daraus Graphen erstellt und diese über AWS Bedrock an Claude weiterleitet, um bei der Fehlersuche bei sporadischen Produktionsfehlern zu helfen. Es generiert auch Architekturdiagramme und Abhängigkeitskarten aus dem Laufzeitverhalten.

OpenClawRadar
Tinte: Eine Bereitstellungsplattform, bei der Claude-KI-Agenten die Hauptnutzer sind
Werkzeuge

Tinte: Eine Bereitstellungsplattform, bei der Claude-KI-Agenten die Hauptnutzer sind

Ink (ml.ink) ist eine Bereitstellungsplattform, die für KI-Agenten wie Claude entwickelt wurde und eine einzige Tool-Aufruf-Bereitstellung, automatische Framework-Erkennung sowie integrierte Dienste wie Rechenleistung, Datenbanken, DNS, Geheimnisse, Domains, Metriken und Protokolle bietet.

OpenClawRadar
Swarm Orchestra v2-Plugin fügt Inter-Agenten-Nachrichtenübertragung hinzu, um das Chaos im Claude-Code-Agenten-Team zu beheben
Werkzeuge

Swarm Orchestra v2-Plugin fügt Inter-Agenten-Nachrichtenübertragung hinzu, um das Chaos im Claude-Code-Agenten-Team zu beheben

Swarm Orchestra ist ein Plugin, das sich mit der experimentellen TeamCreate-Funktion von Claude Code befasst, die außer Kontrolle geratene Agenten erzeugen kann. Version 2 fügt Nachrichtenübermittlung zwischen Agenten über einen PreToolUse-Hook und Selbstkonfiguration über eine /teammate-Fähigkeit hinzu.

OpenClawRadar
InsForge: Eine Backend-Semantikschicht für Claude Code Agents
Werkzeuge

InsForge: Eine Backend-Semantikschicht für Claude Code Agents

InsForge stellt sechs Backend-Primitive bereit – Authentifizierung, Postgres-Datenbank, S3-kompatiblen Speicher, Edge-/Serverless-Funktionen, Model-Gateway und Site-Deployment – als strukturierte Komponenten dar, die Claude Code-Agenten über MCP inspizieren und konfigurieren können, anstatt API-Integrationen erraten zu müssen.

OpenClawRadar