vLLM-Einrichtung und -Tests auf einem 10x-NVIDIA-V100-Server mit 320 GB VRAM

Hardware-Konfiguration und Build-Hinweise
Ein Entwickler hat einen lokalen KI-Server mit 10x Tesla V100 SXM2 32GB GPUs (insgesamt 320GB VRAM) auf einem AMD Threadripper PRO-System aufgebaut. Das Setup verwendet Ubuntu 24.04 headless mit NVIDIA-Treiber 580.126.20. Die GPU-Topologie besteht aus zwei NVLink-Quad-Meshes (GPUs 0-3, 4/5/8/9) plus einem NV6-Paar (GPUs 6-7).
Was auf V100 mit vLLM funktioniert
- FP16 unquantisiert: Hauptpfad mit
--dtype half - bitsandbytes 4-Bit: Funktioniert für Modelle, die für FP16 zu groß sind
- TRITON_ATTN: Automatischer Fallback, da FlashAttention2 SM 80+ erfordert
- Tensor-/Pipeline-Parallelität: TP=4 und TP=4 PP=2 beide erfolgreich getestet
Was auf V100 nicht funktioniert
- GPTQ: ExLlamaV2-Kernel auf SM 7.0 defekt (vLLM Issue #2165)
- AWQ: Erfordert SM 75+
- FP8: Erfordert SM 75+. MiniMax M2.5 verwendet intern FP8 — von vornherein nicht lauffähig.
- FlashAttention2: Erfordert SM 80+
- DeepSeek MLA: Nur für Hopper/Blackwell. Vollständiges DeepSeek V3/R1 kann auf vLLM + V100 nicht ausgeführt werden.
Build-Anforderungen und kritische Korrekturen
PyTorch 2.11.0+cu126 ist erforderlich — cu126 ist die letzte Version mit V100-Unterstützung, da cu128+ Volta fallen lässt. Die Quellkompilierung erfordert TORCH_CUDA_ARCH_LIST="7.0" und MAX_JOBS=20. Ein MoE-Kernel-Patch ist für Issue #36008 erforderlich, der B.size(1) in B.size(0) in fused_moe.py ändert (2 Zeilen). PYTHONNOUSERSITE=1 ist erforderlich, um die Conda-Umgebung von veralteten Systempaketen zu isolieren.
Kritische NCCL-Abhängigkeitskorrektur: pip install -e . zieht nvidia-nccl-cu13 neben nvidia-nccl-cu12 ein. Die cu13-Bibliothek wird zur Laufzeit geladen und verweist auf CUDA 13-Symbole, die in der cu126-Laufzeitumgebung nicht existieren, was bei jedem Multi-GPU-Start zu "NCCL error: unhandled cuda error" führt. Die Korrektur beinhaltet die Deinstallation aller nvidia-*-Pakete und sorgfältiges Abhängigkeitsmanagement.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Lokale Claude-Code-Einrichtung mit Qwen3.5 27B über llama.cpp
Ein Entwickler teilt seine Konfiguration für den lokalen Betrieb von Claude Code mit Qwen3.5 27B und llama.cpp, einschließlich Umgebungsvariablen, Serverparametern und Leistungsbenchmarks über sieben Programmieraufgaben.

12 OpenClaw SOUL.md- und STYLE.md-Vorlagen mit praktischen Lektionen
Ein Entwickler erstellte 12 OpenClaw-Agentenvorlagen für gängige Anwendungsfälle, die jeweils der offiziellen 4-Abschnitts-Spezifikation folgen, und identifizierte wichtige Erkenntnisse, darunter die Notwendigkeit von STYLE.md zur Definition von Kommunikationsmustern und die Bedeutung spezifischer Grenzen gegenüber vagen Persönlichkeitsmerkmalen.

Wie man unerwartete OpenRouter-Kosten in der OpenClaw-Automatisierung vermeidet
Ein Entwicklerteam gab versehentlich 750 US-Dollar in 3 Tagen bei OpenRouter aus, indem es standardmäßig auf Claude Sonnet 4.6 (3 US-Dollar/Mio. Tokens) für alle Automatisierungsaufgaben zurückgriff. Sie reduzierten die Kosten um 97 %, indem sie Standardmodelle änderten, Cron-Jobs und Subagenten auf günstigere Optionen festlegten und teure Modelle nur für sensible Arbeiten reservierten.
