MTP + Mémoire Unifiée améliore l'inférence de llama.cpp de 30% sur RTX 5090

✍️ OpenClawRadar📅 Publié: May 12, 2026🔗 Source
Ad

Combiner GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 avec la prédiction multi-tokens (MTP) dans llama.cpp offre une amélioration du débit d'environ 30 % — 64 tok/s contre 49 tok/s sur un modèle Qwen3.6-27B Q8_0. Le benchmark a été réalisé sur une RTX 5090 associée à 128 Go de DDR5 5600 CL36 et un Ryzen 9 9950X3D.

Commande et configuration

CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
    -m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
    --threads 16 \
    -c 262144 -fa on -np 1 \
    --spec-type mtp --spec-draft-n-max 3 \
    --webui-mcp-proxy \
    --chat-template-kwargs '{"preserve_thinking": true}' \
    --host 0.0.0.0 \
    --port 8090 \
    --jinja

Flags clés :

  • GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 — permet au GPU d'accéder directement à la mémoire hôte, contournant CUDA malloc pour les grands contextes.
  • --spec-type mtp --spec-draft-n-max 3 — active la spéculation MTP avec une profondeur d'ébauche de 3.
  • Qwen3.6-27B-Q8_0.gguf — un modèle Qwen3.6 de 27B paramètres quantifié en Q8_0, préparé avec le support MTP d'Unsloth.
  • -c 262144 — fenêtre de contexte de 256K ; -fa on pour l'attention flash.
Ad

Résultats

  • Sans MTP (mémoire unifiée seulement) : 49 tok/s
  • Avec MTP + mémoire unifiée : 64 tok/s
  • Gain : 30 % de débit en plus

Avec draft-n-max de 3, le modèle spécule jusqu'à 3 tokens à l'avance, réduisant le surcoût de décodage série. Combiné à la mémoire unifiée, cela évite les transferts PCIe coûteux entre le CPU et la RAM du GPU.

À qui cela s'adresse

Développeurs exécutant une inférence locale avec grand contexte sur des GPU grand public haut de gamme (RTX 5090) avec une RAM système abondante (≥128 Go). Convient aux chatbots, assistants de code ou toute charge de travail LLM sensible à la latence où l'échantillonnage spéculatif est pris en charge.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Serveur MCP natif macOS pour le contrôle complet du système d'exploitation
Tools

Serveur MCP natif macOS pour le contrôle complet du système d'exploitation

Un serveur natif macOS offre 24 outils pour des clics précis au pixel, des combinaisons de touches, du glisser-déposer, la gestion d'applications, la prise en charge multi-écrans et l'accès au presse-papiers. Il est open source et fonctionne avec Claude Code, Cursor ou tout client MCP.

OpenClawRadar
AgentChat : Un Réseau Social et Système de Paiement pour Agents IA
Tools

AgentChat : Un Réseau Social et Système de Paiement pour Agents IA

Une nouvelle plateforme permet aux agents IA de se trouver mutuellement, de négocier des emplois de manière autonome et d'être rémunérés pour les tâches accomplies.

OpenClaw Radar
Plugin GTM Open Source pour Claude Code avec 166 Compétences Marketing et Commande Bootstrap
Tools

Plugin GTM Open Source pour Claude Code avec 166 Compétences Marketing et Commande Bootstrap

Un développeur a publié un plugin open source Go-To-Market pour Claude Code qui offre 166 compétences marketing spécialisées dans les domaines du SEO, du contenu, de l'outbound, des ventes, de la croissance, de l'analytique, de la stratégie, des publicités, des réseaux sociaux, du CRM et de la recherche IA. Le plugin inclut une commande /bootstrap qui interroge les utilisateurs sur leur marque pour générer des fichiers de contexte personnalisés.

OpenClawRadar
Caliby : base de données vectorielle embarquée open-source pour agents IA avec stockage hybride texte+vecteurs
Tools

Caliby : base de données vectorielle embarquée open-source pour agents IA avec stockage hybride texte+vecteurs

Caliby est une base de données vectorielle embarquée en C++ avec des liaisons Python (pip install caliby) qui prend en charge les index HNSW, DiskANN et IVF+PQ, revendique des performances 4 fois supérieures à pgvector, et stocke nativement le texte avec les vecteurs pour les cas d'utilisation d'agent IA/RAG.

OpenClawRadar