Benchmarks de performance de Qwen3.5-27B-FP8 avec les agents OpenClaw

✍️ OpenClawRadar📅 Publié: February 28, 2026🔗 Source
Benchmarks de performance de Qwen3.5-27B-FP8 avec les agents OpenClaw
Ad

Benchmarks de performance issus des tests communautaires

Les tests communautaires ont été réalisés avec une seule carte graphique RTX 4090 modifiée disposant de 48 Go de VRAM. Les modèles officiels Qwen3.5-35B-A3B-FP8 et Qwen3.5-27B-FP8 ont été testés avec une longueur de contexte de 256K.

Recommandations de frameworks

SGLang est recommandé comme le seul framework prenant entièrement en charge la mise en cache des préfixes, essentielle pour l'architecture d'attention hybride de Qwen3.5.

  • Pour un contexte de 100K : Le préremplissage à froid prend environ 10 secondes
  • Avec mise en cache : Le préremplissage chute à 200 ms
  • Résultat : Très faible latence du premier token et sortie extrêmement rapide

Métriques de performance des modèles

  • Qwen3.5-35B-A3B-FP8 : Début à 120 tokens/seconde, décroissance à 80 tokens/seconde
  • Qwen3.5-27B-FP8 : Début à 20 tokens/seconde, légère décroissance à 18 tokens/seconde
Ad

Mise à l'échelle des agents OpenClaw

OpenClaw peut exécuter des équipes d'agents avec six agents simultanément, et la vitesse s'adapte pour atteindre 120 tokens/seconde. Le testeur a noté sa surprise face à ce comportement de mise à l'échelle.

L'inconvénient mentionné est que les performances en mono-thread sont lentes avec cette configuration.

Notes d'optimisation MTP

L'activation de MTP (Prédiction Multi-Token) pour le modèle 27B-FP8 peut considérablement augmenter les vitesses de génération pour une seule requête :

  • Sur un seul NVIDIA H100 : Maintient 100 tokens/seconde avec une fenêtre de contexte de 20K
  • Vitesse de préremplissage pour 64K tokens : Moins d'une seconde

Mise en garde importante : MTP est incompatible avec la mise en cache des préfixes et est très gourmand en VRAM. Les utilisateurs avec une RTX 4090 devraient commencer avec un paramètre num-steps plus bas.

📖 Lire la source complète : r/openclaw

Ad

👀 See Also

Claude AI signale des erreurs accrues sur plusieurs plateformes
News

Claude AI signale des erreurs accrues sur plusieurs plateformes

Les systèmes d'IA Claude d'Anthropic ont connu des erreurs accrues sur claude.ai, Claude Console et Claude Code le 2 mars 2026. La page de statut de l'entreprise et le fil de discussion sur les performances Reddit fournissent des rapports de surveillance et de la communauté.

OpenClawRadar
Claude Daily Digest : Lancement de la fonctionnalité /dream, polémique sur les limites d'utilisation et outil d'accessibilité
News

Claude Daily Digest : Lancement de la fonctionnalité /dream, polémique sur les limites d'utilisation et outil d'accessibilité

Anthropic a lancé la fonctionnalité /dream pour le système de mémoire automatique de Claude, tandis que la communauté fait face à des plaintes concernant les limites d'utilisation et un développeur sourd a créé un plugin de notification flash en terminal pour Claude Code.

OpenClawRadar
🦀
News

Mises à jour d'OpenClaw cassant les configurations : ce que font les utilisateurs à ce sujet

Un utilisateur gérant 5 sites avec OpenClaw, Claude Code et Codex explique que les mises à jour cassent souvent leur configuration fonctionnelle, les incitant à adopter une approche prudente.

OpenClawRadar
OpenClaw 2026.6.5 : Recherche parallèle gratuite, correctifs de stabilité généralisés
News

OpenClaw 2026.6.5 : Recherche parallèle gratuite, correctifs de stabilité généralisés

OpenClaw 2026.6.5 ajoute la recherche parallèle gratuite et sans configuration, des réponses plus sûres sur les canaux, une meilleure récupération des exécutions d'agents, et une configuration fournisseur/modèle moins fragile.

OpenClawRadar