Benchmarks de performance de Qwen3.5-27B-FP8 avec les agents OpenClaw

Benchmarks de performance issus des tests communautaires
Les tests communautaires ont été réalisés avec une seule carte graphique RTX 4090 modifiée disposant de 48 Go de VRAM. Les modèles officiels Qwen3.5-35B-A3B-FP8 et Qwen3.5-27B-FP8 ont été testés avec une longueur de contexte de 256K.
Recommandations de frameworks
SGLang est recommandé comme le seul framework prenant entièrement en charge la mise en cache des préfixes, essentielle pour l'architecture d'attention hybride de Qwen3.5.
- Pour un contexte de 100K : Le préremplissage à froid prend environ 10 secondes
- Avec mise en cache : Le préremplissage chute à 200 ms
- Résultat : Très faible latence du premier token et sortie extrêmement rapide
Métriques de performance des modèles
- Qwen3.5-35B-A3B-FP8 : Début à 120 tokens/seconde, décroissance à 80 tokens/seconde
- Qwen3.5-27B-FP8 : Début à 20 tokens/seconde, légère décroissance à 18 tokens/seconde
Mise à l'échelle des agents OpenClaw
OpenClaw peut exécuter des équipes d'agents avec six agents simultanément, et la vitesse s'adapte pour atteindre 120 tokens/seconde. Le testeur a noté sa surprise face à ce comportement de mise à l'échelle.
L'inconvénient mentionné est que les performances en mono-thread sont lentes avec cette configuration.
Notes d'optimisation MTP
L'activation de MTP (Prédiction Multi-Token) pour le modèle 27B-FP8 peut considérablement augmenter les vitesses de génération pour une seule requête :
- Sur un seul NVIDIA H100 : Maintient 100 tokens/seconde avec une fenêtre de contexte de 20K
- Vitesse de préremplissage pour 64K tokens : Moins d'une seconde
Mise en garde importante : MTP est incompatible avec la mise en cache des préfixes et est très gourmand en VRAM. Les utilisateurs avec une RTX 4090 devraient commencer avec un paramètre num-steps plus bas.
📖 Lire la source complète : r/openclaw
👀 See Also

Claude AI signale des erreurs accrues sur plusieurs plateformes
Les systèmes d'IA Claude d'Anthropic ont connu des erreurs accrues sur claude.ai, Claude Console et Claude Code le 2 mars 2026. La page de statut de l'entreprise et le fil de discussion sur les performances Reddit fournissent des rapports de surveillance et de la communauté.

Claude Daily Digest : Lancement de la fonctionnalité /dream, polémique sur les limites d'utilisation et outil d'accessibilité
Anthropic a lancé la fonctionnalité /dream pour le système de mémoire automatique de Claude, tandis que la communauté fait face à des plaintes concernant les limites d'utilisation et un développeur sourd a créé un plugin de notification flash en terminal pour Claude Code.
Mises à jour d'OpenClaw cassant les configurations : ce que font les utilisateurs à ce sujet
Un utilisateur gérant 5 sites avec OpenClaw, Claude Code et Codex explique que les mises à jour cassent souvent leur configuration fonctionnelle, les incitant à adopter une approche prudente.

OpenClaw 2026.6.5 : Recherche parallèle gratuite, correctifs de stabilité généralisés
OpenClaw 2026.6.5 ajoute la recherche parallèle gratuite et sans configuration, des réponses plus sûres sur les canaux, une meilleure récupération des exécutions d'agents, et une configuration fournisseur/modèle moins fragile.