Exécution de MiniMax M2.7 Q8_0 128K sur 2x3090 avec déchargement CPU – Benchmarks réels et configuration

✍️ OpenClawRadar📅 Publié: May 17, 2026🔗 Source
Exécution de MiniMax M2.7 Q8_0 128K sur 2x3090 avec déchargement CPU – Benchmarks réels et configuration
Ad

Dans un récent post sur r/LocalLLaMA, un utilisateur partage son expérience de poussée du modèle MiniMax M2.7 (en quantification Q8_0) jusqu'à un contexte de 128K sur une configuration 2x3090 avec 256 Go de DDR4 et un CPU 10900X d'occasion. Le principal défi : faire fonctionner un grand modèle MoE avec un cache KV non quantifié sur du matériel relativement modeste pour sa catégorie.

Chiffres de performance

L'utilisateur rapporte :

  • Traitement de requête : environ 50 tokens par seconde
  • Génération de tokens : environ 10 tokens par seconde
  • Qualifié de « très lent mais utilisable pour les workflows d'agent de codage »

Configuration

Ils utilisent ik-llama-cuda (un fork de llama.cpp) avec les paramètres suivants (depuis leur configuration NixOS) :

${ik-llama-cuda}/bin/llama-server \
  -m ${modelPath} \
  --host 0.0.0.0 \
  --port ${toString cfg.port} \
  -c ${toString cfg.contextLength} \
  -ngl 999 \
  --cpu-moe \
  -sm graph \
  -fa on \
  -t 16 \
  -tb 16 \
  -b 4096 \
  -ub 4096 \
  -np 1 \
  -muge \
  -ger \
  --jinja \
  --metrics \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 40 \
  --min-p 0.01

Paramètres notables :

  • --cpu-moe – décharge le calcul des experts MoE sur le CPU
  • -sm graph – active l'ordonnancement basé sur un graphe
  • -fa on – attention flash
  • -t 16 / -tb 16 – 16 threads pour le calcul et le lot respectivement
  • -b 4096 / -ub 4096 – taille de lot et de sous-lot
  • -muge – chargement d'expert guidé par l'utilisation mémoire (probablement)
  • -ger – routage d'expert sur GPU

Ad

Contexte et motivation

L'utilisateur indique que le Q8_0 a été choisi pour atténuer un « comportement étrange » observé avec des quantifications inférieures. Il note que le modèle de brouillon pour le décodage spéculatif n'a pas été publié pour M2.7, ce qui aurait pu améliorer la vitesse. Il est principalement intéressé par la précision plutôt que la vitesse, tant que la génération ne prend pas « littéralement toute la journée ».

Enseignement pour les développeurs

Il s'agit d'un point de référence pratique pour quiconque exécute de grands modèles MoE sur des configurations multi-GPU avec de la RAM système. L'approche --cpu-moe permet d'étendre le contexte bien au-delà des limites de la VRAM, bien qu'à vitesse réduite. Pour les workflows d'agent de codage où la latence est moins critique, ce compromis peut être acceptable.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Agents d'audit parallèles : une approche pratique des tests codés par ambiance avec Claude
Tips

Agents d'audit parallèles : une approche pratique des tests codés par ambiance avec Claude

Un développeur a construit un système de test utilisateur avec Claude utilisant 10 agents d'audit parallèles couvrant la détection d'hallucination, le sentinelle API, le test de résistance UI, l'anonymisation PII, le SEO, la conformité légale, la simulation comportementale, les personas démographiques, le test d'entonnoir et la vérification des faits.

OpenClawRadar
Maître des Jetons : Concept Architectural pour Économiser 30 à 70 % sur les Coûts des Agents IA
Tips

Maître des Jetons : Concept Architectural pour Économiser 30 à 70 % sur les Coûts des Agents IA

Une approche architecturale détaillée pour le routage intelligent multi-modèles qui peut réduire considérablement la consommation de tokens.

OpenClaw Radar
OpenClaw WhatsApp Réponse Automatique Peut Ignorer la Compréhension des Médias dans la Version 2026.4.2
Tips

OpenClaw WhatsApp Réponse Automatique Peut Ignorer la Compréhension des Médias dans la Version 2026.4.2

Un utilisateur signale que le flux de réponse automatique WhatsApp d'OpenClaw 2026.4.2 peut contourner le pipeline de compréhension des médias, empêchant la transcription des notes vocales lors de l'utilisation de backends STT externes comme Groq. La solution implique d'appeler explicitement la compréhension des médias avant l'envoi à l'agent.

OpenClawRadar
OpenClaw sur M4 Pro : Obstacles avec l'utilisation du navigateur, de l'ordinateur et du Codex
Tips

OpenClaw sur M4 Pro : Obstacles avec l'utilisation du navigateur, de l'ordinateur et du Codex

Un utilisateur signale des agents bloqués dans des boucles terminales, des blocages sur des sites, et des sorties Codex dégradées, cherchant des ajustements de configuration pour le navigateur d'automatisation, le contrôle de l'interface graphique macOS et les boucles d'interruption.

OpenClawRadar