Kit de LLM Blackwell : Configs NVFP4, Wheels et benchmarks pour TensorRT-LLM sur RTX Pro 6000

Un nouveau dépôt sur GitHub, blackwell-llm-toolkit, rassemble des configurations TensorRT-LLM, des wheels préconstruites et des résultats de benchmark pour exécuter des LLM sur les GPU Nvidia Blackwell (RTX Pro 6000, 5090, 5080, 5070 Ti). L'accent est mis sur la quantification NVFP4 et la résolution de problèmes spécifiques à la plateforme.
Fonctionnalités clés
- Configurations TensorRT-LLM : Inclut un fichier YAML (
configs/trtllm/nemotron-omni-v3-sm120.yaml) avec les drapeaux de lancement obscurs nécessaires pour exécuter des modèles hybrides Mamba sur Blackwell. - Wheels LMCache : La wheel PyPI plantait sur Blackwell en raison de l'absence de cubins sm_120. Le dépôt fournit une wheel reconstruite et un script de build, testés avec un SSD Optane pour le déchargement du cache KV.
- Documents de recherche : Plongées approfondies générées par IA sur les différences architecturales de Nemotron Omni V3, Qwen 3.5/3.6 et Gemma 4. Notamment, Qwen 3.5/3.6 ne sont pas simplement des Qwen3-VL renommés — ils ont une architecture complètement différente.
- Harness de benchmark :
rapid_bench.pyexécute une évaluation de qualité sur 41 prompts (intelligence, utilisation d'outils, calibration, orchestration, écriture créative).bench_harness.pymesure le décodage soutenu, le TTFT, le préremplissage et la concurrence, avec un mode--prompt-tokens Npour les longs contextes.
Points forts des benchmarks (RTX Pro 6000 96 Go seul, sans TP)
- Nemotron-3-Nano-Omni V3 (multimodal, NVFP4, contexte 8k) : 270 tok/s. Modèle le plus rapide testé, gère image/vidéo/audio+texte. Nécessite TRT-LLM v1.3.0rc13.
- Nemotron-3-Nano (texte uniquement, NVFP4, contexte 8k) : 249 tok/s. Meilleur pour les agents utilisant des outils (10/10 sur les outils).
- DeepSeek-V4-Flash (IQ2_XXS-XL GGUF, contexte 65k) : 31 tok/s. Meilleur pour le raisonnement complexe (9/10 en intelligence, 10/10 en outils, 13/13 en calibration).
- MiniMax-M2.7-REAP-172B (Q3_K_S GGUF, contexte 196k) : 117 tok/s. Bon pour les longues conversations.
- MiniMax-M2.7 W4A16 (avec LMCache sur SSD Optane, contexte 154k) : 20-22 tok/s. Qualité à long contexte W4A16.
- MiniMax-M2.7 W4A16 (contexte court, sans LMCache, contexte 64k) : 22-25 tok/s. Réponses courtes de la plus haute qualité (10/10 en intelligence).
Les résultats complets avec TTFT, vitesses de préremplissage, concurrence et scores d'évaluation sont dans bench/results.md.
À qui cela s'adresse
Développeurs et chercheurs exécutant des inférences LLM sur des GPU Blackwell qui ont besoin de configurations TensorRT-LLM optimisées, de LMCache préconstruite pour le déchargement à long contexte, ou de données de benchmark réelles pour la sélection de modèles.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Résultats de référence : L'Agent en essaim Claude avec système de mémoire permet des économies de coûts de tokens de 30 à 43 %
Un développeur a testé un essaim de 6 agents Claude sur une tâche de codage de 40 points, avec et sans un système de mémoire personnalisé appelé Stompy. Les résultats montrent que Sonnet 4.6 avec mémoire a obtenu des scores parfaits à 3,98 $ contre 7,04 $ sans, tandis que Haiku 4.5 a complètement échoué sans mémoire mais a obtenu 39/40 avec.

Agent OpenClaw conserve la mémoire lors du passage de l'abonnement Claude à l'API
Un développeur rapporte avoir migré avec succès sa configuration OpenClaw d'un abonnement Claude vers une clé API sans perdre la mémoire de l'agent, en utilisant la compétence mengram-memory qui sauvegarde dans une couche externe. L'agent a conservé ~100+ faits appris, des procédures évoluées et des souvenirs épisodiques.

Culpa : Moteur de relecture déterministe open source pour le débogage d'agents IA
Culpa est un outil open source qui enregistre les sessions d'agents LLM avec un contexte d'exécution complet, permettant une relecture déterministe en utilisant les réponses enregistrées comme substituts au lieu d'accéder aux véritables API. Il fonctionne avec les API Anthropic et OpenAI via un mode proxy ou un SDK Python.

Benchmark d'analyse de code par IA : Comparaison de Claude, Gemini, Codex, Qwen et MiniMax
Un benchmark a testé cinq modèles d'IA sur 15 demandes de tirage Milvus contenant des bogues connus. Claude a détecté 53 % des bogues en mode brut, tandis qu'un débat contradictoire entre les modèles a augmenté la détection à 80 %.