Configuration et tests de vLLM sur un serveur équipé de 10x NVIDIA V100 avec 320 Go de VRAM

Configuration matérielle et notes de construction
Un développeur a construit un serveur IA local avec 10 GPU Tesla V100 SXM2 32 Go (320 Go de VRAM au total) sur un système AMD Threadripper PRO. La configuration utilise Ubuntu 24.04 headless avec le pilote NVIDIA 580.126.20. La topologie GPU comprend deux maillages quad NVLink (GPU 0-3, 4/5/8/9) plus une paire NV6 (GPU 6-7).
Ce qui fonctionne sur V100 avec vLLM
- FP16 non quantifié : Voie principale utilisant
--dtype half - bitsandbytes 4 bits : Fonctionne pour les modèles trop grands pour FP16
- TRITON_ATTN : Repli automatique car FlashAttention2 nécessite SM 80+
- Parallélisme tensoriel/pipeline : TP=4 et TP=4 PP=2 tous deux testés avec succès
Ce qui ne fonctionne pas sur V100
- GPTQ : Noyaux ExLlamaV2 cassés sur SM 7.0 (problème vLLM #2165)
- AWQ : Nécessite SM 75+
- FP8 : Nécessite SM 75+. MiniMax M2.5 utilise FP8 en interne — mort-né.
- FlashAttention2 : Nécessite SM 80+
- DeepSeek MLA : Hopper/Blackwell uniquement. DeepSeek V3/R1 complet ne peut pas fonctionner sur vLLM + V100.
Exigences de construction et correctifs critiques
PyTorch 2.11.0+cu126 est requis — cu126 est la dernière version avec support V100 car cu128+ abandonne Volta. La compilation source nécessite TORCH_CUDA_ARCH_LIST="7.0" et MAX_JOBS=20. Un correctif de noyau MoE est nécessaire pour le problème #36008, changeant B.size(1) en B.size(0) dans fused_moe.py (2 lignes). PYTHONNOUSERSITE=1 est requis pour isoler l'environnement conda des packages système obsolètes.
Correctif critique de dépendance NCCL : pip install -e . récupère nvidia-nccl-cu13 avec nvidia-nccl-cu12. La bibliothèque cu13 est chargée au runtime et référence des symboles CUDA 13 qui n'existent pas dans l'environnement d'exécution cu126, entraînant "erreur NCCL : erreur cuda non gérée" à chaque lancement multi-GPU. La solution implique de désinstaller tous les packages nvidia-* et de gérer les dépendances avec soin.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Qwen3.5-397B MoE fonctionne avec 14 Go de RAM via un chargement d'expert paginé sur M1 Ultra
Le moteur Paged MoE ne conserve que 20 experts en mémoire et charge paresseusement le reste depuis le SSD, faisant tourner un modèle de 397B (209 Go) sur un Mac Studio de 64 Go avec 1,59 tok/s et 14 Go de RAM de pointe. Comprend des benchmarks de modèles plus petits.

6 modèles qui font réellement s'activer les fichiers de compétences de Claude Code
Après avoir testé plus de 2 300 fichiers de compétences, un développeur a identifié 6 modèles déterminant si une compétence Claude Code se charge en cas de besoin – notamment un langage de déclenchement spécifique, une capacité par fichier et des listes de cas où ne pas l'utiliser.

Mise en œuvre d'un Système de Méditation Récurrente pour la Cohérence de l'Agent OpenClaw
Un développeur partage un système de réflexion structuré pour les agents OpenClaw utilisant une chaîne de fichiers spécifique incluant meditations.md, reflections/*.md et des fichiers d'identité. La boucle nocturne implique de revoir et d'ajouter à ces fichiers pour favoriser des insights sur des changements de comportement durables.

Trace de la Pile LLM de Bout en Bout : De la Frappe au Jeton Diffusé en Continu
Un ingénieur logiciel a créé un document complet retraçant chaque couche de la pile lors de l'envoi d'une requête à un LLM, couvrant le comptage de tokens côté client, les protocoles réseau, les passerelles API, les classificateurs de sécurité, la tokenisation, le cache KV, le pipeline d'échantillonnage et les mécanismes de streaming.