Qwen 3.6 27B avec MTP sur V100 32GB : 54 t/s via la branche llama.cpp

Un utilisateur sur r/LocalLLaMA rapporte des résultats impressionnants en exécutant Qwen 3.6 27B avec Multi-Token Prediction (MTP) sur un module V100 32GB SXM via un adaptateur PCIe. La configuration utilise la branche MTP d'am17an de llama.cpp et la quantification MTP GGUF correspondante. Spécifications clés : cache KV Q8_0 avec une limite de 200k, fonctionnant comme backend pour VS Code Copilot via llama-server.
Performances
- Sans MTP : 29-30 tokens/seconde
- Avec MTP : 54-55 tokens/seconde (limité à 150W)
- Après 50k tokens de contexte : chute à 40-45 t/s
Branche : le fork MTP d'am17an. La compilation et l'exécution ont été simples — « tiré et编译é en une seule fois » avec llama-server fonctionnant sans problème. La configuration gère bien les appels d'outils et les sous-agents, et a fourni « des revues de code et des refactorisations très perspicaces » malgré la limite de VRAM (32 Go).
C'est particulièrement pertinent pour les développeurs qui exécutent des LLM sur du matériel de datacenter plus ancien comme les V100. MTP double effectivement le débit pour ce modèle, démontrant des gains pratiques pour les charges de travail d'assistant de codage.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Mnemos : un serveur MCP pour la mémoire persistante de Claude Code
Mnemos est un serveur MCP open-source qui offre à Claude Code une mémoire persistante entre les sessions, en enregistrant les corrections sous forme de motifs structurés et en poussant un contexte classé au démarrage. Un seul binaire Go de 15 Mo, pas besoin de Docker ni de base vectorielle.

Utilisateur d'OpenClaw critique l'architecture de l'outil et ses lacunes en matière de sécurité.
Un utilisateur de Reddit décrit OpenClaw comme le seul outil qui rend ce type d'automatisation d'agent aussi accessible, mais critique son architecture pour son manque de couche de contrôle pour les opérations sur fichiers, d'un noyau protégé, d'une gestion de contexte appropriée, et de fonctionnalités intégrées de versioning ou de tests.

Madar : Compilateur de contexte local pour Claude Code / Cursor — 78 % de tokens en moins sur le dépôt NestJS
Madar est un compilateur de contexte local open source pour les agents de codage. Sur un repo NestJS + BullMQ (~800 fichiers), il a réduit les tokens d'entrée de Claude Code de 78 % et le coût de 63 % pour une tâche d'explication. Graphes limités uniquement.

FR: Crit : CLI binaire unique, priorité locale, pour examiner les plans d'agent et les diffs
Crit est un outil CLI en un seul binaire qui ouvre des fichiers ou des diffs dans un navigateur avec une interface inspirée de GitHub, permettant des boucles de rétroaction multi-tours avec des agents IA de codage — sans besoin de compte.