Exécution de MiniMax M2.7 Q8_0 128K sur 2x3090 avec déchargement CPU – Benchmarks réels et configuration

Dans un récent post sur r/LocalLLaMA, un utilisateur partage son expérience de poussée du modèle MiniMax M2.7 (en quantification Q8_0) jusqu'à un contexte de 128K sur une configuration 2x3090 avec 256 Go de DDR4 et un CPU 10900X d'occasion. Le principal défi : faire fonctionner un grand modèle MoE avec un cache KV non quantifié sur du matériel relativement modeste pour sa catégorie.
Chiffres de performance
L'utilisateur rapporte :
- Traitement de requête : environ 50 tokens par seconde
- Génération de tokens : environ 10 tokens par seconde
- Qualifié de « très lent mais utilisable pour les workflows d'agent de codage »
Configuration
Ils utilisent ik-llama-cuda (un fork de llama.cpp) avec les paramètres suivants (depuis leur configuration NixOS) :
${ik-llama-cuda}/bin/llama-server \
-m ${modelPath} \
--host 0.0.0.0 \
--port ${toString cfg.port} \
-c ${toString cfg.contextLength} \
-ngl 999 \
--cpu-moe \
-sm graph \
-fa on \
-t 16 \
-tb 16 \
-b 4096 \
-ub 4096 \
-np 1 \
-muge \
-ger \
--jinja \
--metrics \
--temp 1.0 \
--top-p 0.95 \
--top-k 40 \
--min-p 0.01Paramètres notables :
--cpu-moe– décharge le calcul des experts MoE sur le CPU-sm graph– active l'ordonnancement basé sur un graphe-fa on– attention flash-t 16/-tb 16– 16 threads pour le calcul et le lot respectivement-b 4096/-ub 4096– taille de lot et de sous-lot-muge– chargement d'expert guidé par l'utilisation mémoire (probablement)-ger– routage d'expert sur GPU
Contexte et motivation
L'utilisateur indique que le Q8_0 a été choisi pour atténuer un « comportement étrange » observé avec des quantifications inférieures. Il note que le modèle de brouillon pour le décodage spéculatif n'a pas été publié pour M2.7, ce qui aurait pu améliorer la vitesse. Il est principalement intéressé par la précision plutôt que la vitesse, tant que la génération ne prend pas « littéralement toute la journée ».
Enseignement pour les développeurs
Il s'agit d'un point de référence pratique pour quiconque exécute de grands modèles MoE sur des configurations multi-GPU avec de la RAM système. L'approche --cpu-moe permet d'étendre le contexte bien au-delà des limites de la VRAM, bien qu'à vitesse réduite. Pour les workflows d'agent de codage où la latence est moins critique, ce compromis peut être acceptable.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Agents d'audit parallèles : une approche pratique des tests codés par ambiance avec Claude
Un développeur a construit un système de test utilisateur avec Claude utilisant 10 agents d'audit parallèles couvrant la détection d'hallucination, le sentinelle API, le test de résistance UI, l'anonymisation PII, le SEO, la conformité légale, la simulation comportementale, les personas démographiques, le test d'entonnoir et la vérification des faits.

Maître des Jetons : Concept Architectural pour Économiser 30 à 70 % sur les Coûts des Agents IA
Une approche architecturale détaillée pour le routage intelligent multi-modèles qui peut réduire considérablement la consommation de tokens.

OpenClaw WhatsApp Réponse Automatique Peut Ignorer la Compréhension des Médias dans la Version 2026.4.2
Un utilisateur signale que le flux de réponse automatique WhatsApp d'OpenClaw 2026.4.2 peut contourner le pipeline de compréhension des médias, empêchant la transcription des notes vocales lors de l'utilisation de backends STT externes comme Groq. La solution implique d'appeler explicitement la compréhension des médias avant l'envoi à l'agent.

OpenClaw sur M4 Pro : Obstacles avec l'utilisation du navigateur, de l'ordinateur et du Codex
Un utilisateur signale des agents bloqués dans des boucles terminales, des blocages sur des sites, et des sorties Codex dégradées, cherchant des ajustements de configuration pour le navigateur d'automatisation, le contrôle de l'interface graphique macOS et les boucles d'interruption.