Qwen 3.6 27B avec MTP sur V100 32GB : 54 t/s via la branche llama.cpp

Un utilisateur sur r/LocalLLaMA rapporte des résultats impressionnants en exécutant Qwen 3.6 27B avec Multi-Token Prediction (MTP) sur un module V100 32GB SXM via un adaptateur PCIe. La configuration utilise la branche MTP d'am17an de llama.cpp et la quantification MTP GGUF correspondante. Spécifications clés : cache KV Q8_0 avec une limite de 200k, fonctionnant comme backend pour VS Code Copilot via llama-server.
Performances
- Sans MTP : 29-30 tokens/seconde
- Avec MTP : 54-55 tokens/seconde (limité à 150W)
- Après 50k tokens de contexte : chute à 40-45 t/s
Branche : le fork MTP d'am17an. La compilation et l'exécution ont été simples — « tiré et编译é en une seule fois » avec llama-server fonctionnant sans problème. La configuration gère bien les appels d'outils et les sous-agents, et a fourni « des revues de code et des refactorisations très perspicaces » malgré la limite de VRAM (32 Go).
C'est particulièrement pertinent pour les développeurs qui exécutent des LLM sur du matériel de datacenter plus ancien comme les V100. MTP double effectivement le débit pour ce modèle, démontrant des gains pratiques pour les charges de travail d'assistant de codage.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

French Translation: Conception Ouverte : Alternative Open-Source au Design Claude Fonctionnant sur vos Agents CLI Locaux
Open Design est un moteur de conception local-first et BYOK qui transforme 11 CLI d'agents de codage (Claude Code, Codex, Cursor, Gemini CLI, etc.) en un workflow de conception avec 72 systèmes de design de qualité professionnelle et 31 compétences composables, exportant HTML/PDF/PPTX/MP4.

Krasis : un runtime hybride CPU/GPU pour les grands modèles MoE atteint 3 324 tok/s en pré-remplissage sur RTX 5080
Krasis est un runtime hybride CPU/GPU conçu pour exécuter de grands modèles MoE en traitant le préremplissage sur GPU et le décodage sur CPU, atteignant 3 324 tokens/seconde en préremplissage sur un RTX 5080 avec Qwen3-Coder-Next 80B Q4. Il nécessite environ 2,5 fois la taille du modèle en RAM système mais permet d'exécuter des modèles trop volumineux pour la VRAM.

Solution de contournement pour le déficit de migration de projet ChatGPT : Exporter les scripts et les invites
Un développeur a créé des scripts Python et des prompts Claude pour migrer des conversations de ChatGPT vers Claude lorsque l'exportation de données de ChatGPT ne contient pas les informations d'appartenance aux projets. La solution extrait les conversations en utilisant les titres capturés depuis l'interface.
Pizza Bot : Boîte de réception auto-hébergée pour agents IA de longue durée, Apache 2.0
Pizza Bot est une application de bureau auto-hébergée pour Mac, Windows et Linux qui exécute des agents IA en arrière-plan derrière une interface de type e-mail. Le travail terminé arrive dans Non lus, les approbations font la queue dans Action.