Blackwell LLM Toolkit: NVFP4-Konfigurationen, Räder und Benchmarks für TensorRT-LLM auf RTX Pro 6000

✍️ OpenClawRadar📅 Veröffentlicht: 12. Mai 2026🔗 Source
Blackwell LLM Toolkit: NVFP4-Konfigurationen, Räder und Benchmarks für TensorRT-LLM auf RTX Pro 6000
Ad

Ein neues Repository auf GitHub, blackwell-llm-toolkit, sammelt TensorRT-LLM-Konfigurationen, vorgebaute Räder und Benchmark-Ergebnisse für den Betrieb von LLMs auf Nvidia Blackwell GPUs (RTX Pro 6000, 5090, 5080, 5070 Ti). Der Fokus liegt auf NVFP4-Quantisierung und der Überwindung plattformspezifischer Hürden.

Hauptfunktionen

  • TensorRT-LLM-Konfigurationen: Enthält eine YAML-Datei (configs/trtllm/nemotron-omni-v3-sm120.yaml) mit den obskuren Startflags, die zum Ausführen von Mamba-Hybrid-Modellen auf Blackwell erforderlich sind.
  • LMCache-Räder: Das PyPI-Rad stürzte auf Blackwell aufgrund fehlender sm_120-Cubins ab. Das Repository bietet ein neu gebautes Rad und ein Build-Skript, getestet mit Optane SSD für KV-Cache-Auslagerung.
  • Forschungsdokumente: KI-generierte Deep-Dives zu Architekturunterschieden bei Nemotron Omni V3, Qwen 3.5/3.6 und Gemma 4. Beachten Sie: Qwen 3.5/3.6 sind nicht nur umbenannte Qwen3-VL – sie haben eine völlig andere Architektur.
  • Benchmark-Tools: rapid_bench.py führt eine Qualitätsbewertung mit 41 Prompts durch (Intelligenz, Tool-Nutzung, Kalibrierung, Orchestrierung, kreatives Schreiben). bench_harness.py misst anhaltende Dekodierung, TTFT, Prefill und Parallelität, mit einem --prompt-tokens N Modus für langen Kontext.
Ad

Benchmark-Highlights (Einzelne RTX Pro 6000 96GB, kein TP)

  • Nemotron-3-Nano-Omni V3 (multimodal, NVFP4, 8k Kontext): 270 tok/s. Schnellstes getestetes Modell, verarbeitet Bild/Video/Audio+Text. Erfordert TRT-LLM v1.3.0rc13.
  • Nemotron-3-Nano (nur Text, NVFP4, 8k Kontext): 249 tok/s. Am besten für Tool-Calling-Agenten (10/10 bei Tools).
  • DeepSeek-V4-Flash (IQ2_XXS-XL GGUF, 65k Kontext): 31 tok/s. Am besten für komplexes Denken (9/10 Intel, 10/10 Tools, 13/13 Kalibrierung).
  • MiniMax-M2.7-REAP-172B (Q3_K_S GGUF, 196k Kontext): 117 tok/s. Gut für lange Gespräche.
  • MiniMax-M2.7 W4A16 (mit LMCache auf Optane SSD, 154k Kontext): 20-22 tok/s. Lange Kontextqualität bei W4A16.
  • MiniMax-M2.7 W4A16 (kurzer Kontext, ohne LMCache, 64k Kontext): 22-25 tok/s. Höchste Qualität bei kurzen Antworten (10/10 Intel).

Vollständige Ergebnisse mit TTFT, Prefill-Geschwindigkeiten, Parallelität und Bewertungswerten finden Sie in bench/results.md.

Für wen es gedacht ist

Entwickler und Forscher, die LLM-Inferenz auf Blackwell GPUs betreiben und optimierte TensorRT-LLM-Konfigurationen, vorgebaute LMCache für langen Kontext oder reale Benchmark-Daten zur Modellauswahl benötigen.

📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

MCP-Server ermöglicht KI-Agenten reale Einkäufe mit ephemeren virtuellen Karten
Werkzeuge

MCP-Server ermöglicht KI-Agenten reale Einkäufe mit ephemeren virtuellen Karten

Ein Entwickler hat einen MCP-Server erstellt, der KI-Agenten ermöglicht, echte Einkäufe mit kurzlebigen virtuellen Visa-Karten zu tätigen. Das System erfordert eine Benutzerfreigabe per MFA und gibt Karten aus, die an bestimmte Händler gebunden sind und eine Gültigkeitsdauer von 15 Minuten haben.

OpenClawRadar
Soul MCP Server fügt lokalen LLMs persistente Speicher und Sicherheit hinzu
Werkzeuge

Soul MCP Server fügt lokalen LLMs persistente Speicher und Sicherheit hinzu

Soul ist ein Open-Source-MCP-Server, der lokalen LLMs persistente Speicherung über Sitzungen hinweg ermöglicht, und zwar mit zwei Befehlen: n2_boot zu Beginn und n2_work_end am Ende. Er enthält Ark-Sicherheitsfunktionen, die gefährliche Befehle wie rm -rf und DROP DATABASE ohne Token-Kosten blockieren, sowie eine Cloud-Speicherkonfiguration.

OpenClawRadar
yburn: Tool zur Überprüfung und zum Ersetzen unnötiger KI-Agent-Cron-Jobs
Werkzeuge

yburn: Tool zur Überprüfung und zum Ersetzen unnötiger KI-Agent-Cron-Jobs

yburn ist ein Python-Tool, das KI-Agenten-Cronjobs überprüft und solche, die keine LLMs benötigen, durch eigenständige Python-Skripte ersetzt. Der Ersteller stellte fest, dass 58 % von 98 Cronjobs rein mechanische Aufgaben wie Systemgesundheitsprüfungen und Git-Backups waren.

OpenClawRadar
Entwickler teilt Lösung für Claude KI, die Regeln ignoriert, sobald 50-Zählerschwelle überschritten wird
Werkzeuge

Entwickler teilt Lösung für Claude KI, die Regeln ignoriert, sobald 50-Zählerschwelle überschritten wird

Ein Entwickler berichtet, dass Claude Code Regeln stillschweigend ausließ, sobald ihr gemeinsamer Regelsatz etwa 50 Einträge überschritt, insbesondere bei frontend-lastigen Aufgaben. Sie entwickelten einen Hook, der Prompts scannt und basierend auf Schlüsselwortabgleich nur 2-3 relevante Regeln lädt.

OpenClawRadar