Benchmarks de performance de Qwen3.5-27B-FP8 avec les agents OpenClaw

Benchmarks de performance issus des tests communautaires
Les tests communautaires ont été réalisés avec une seule carte graphique RTX 4090 modifiée disposant de 48 Go de VRAM. Les modèles officiels Qwen3.5-35B-A3B-FP8 et Qwen3.5-27B-FP8 ont été testés avec une longueur de contexte de 256K.
Recommandations de frameworks
SGLang est recommandé comme le seul framework prenant entièrement en charge la mise en cache des préfixes, essentielle pour l'architecture d'attention hybride de Qwen3.5.
- Pour un contexte de 100K : Le préremplissage à froid prend environ 10 secondes
- Avec mise en cache : Le préremplissage chute à 200 ms
- Résultat : Très faible latence du premier token et sortie extrêmement rapide
Métriques de performance des modèles
- Qwen3.5-35B-A3B-FP8 : Début à 120 tokens/seconde, décroissance à 80 tokens/seconde
- Qwen3.5-27B-FP8 : Début à 20 tokens/seconde, légère décroissance à 18 tokens/seconde
Mise à l'échelle des agents OpenClaw
OpenClaw peut exécuter des équipes d'agents avec six agents simultanément, et la vitesse s'adapte pour atteindre 120 tokens/seconde. Le testeur a noté sa surprise face à ce comportement de mise à l'échelle.
L'inconvénient mentionné est que les performances en mono-thread sont lentes avec cette configuration.
Notes d'optimisation MTP
L'activation de MTP (Prédiction Multi-Token) pour le modèle 27B-FP8 peut considérablement augmenter les vitesses de génération pour une seule requête :
- Sur un seul NVIDIA H100 : Maintient 100 tokens/seconde avec une fenêtre de contexte de 20K
- Vitesse de préremplissage pour 64K tokens : Moins d'une seconde
Mise en garde importante : MTP est incompatible avec la mise en cache des préfixes et est très gourmand en VRAM. Les utilisateurs avec une RTX 4090 devraient commencer avec un paramètre num-steps plus bas.
📖 Lire la source complète : r/openclaw
👀 See Also

PDG d'hôpital affirme que l'IA est prête à remplacer les radiologues
Le PDG du plus grand système hospitalier public américain affirme qu'il est prêt à remplacer les radiologues par l'IA, selon un article de Radiology Business qui a suscité une discussion importante sur Hacker News avec 83 commentaires.

Claude Code v2.1.158 : Mode automatique désormais disponible sur Bedrock, Vertex, Foundry pour Opus 4.7/4.8
Claude Code v2.1.158 active le mode automatique sur Bedrock, Vertex et Foundry pour Opus 4.7 et 4.8. Activez-le avec CLAUDE_CODE_ENABLE_AUTO_MODE=1.

Les coûts de l'API OpenClaw atteignent 275 $ en 5,5 heures, soit une projection annuelle de plus de 200 000 $
Un développeur testant OpenClaw avec l'API GPT-5.4 d'OpenAI a dépensé 275 $ entre 11h et 16h30, ce qui équivaut à plus de 200 000 $ par an à ce rythme d'utilisation.

Palantir IA à intégrer dans l'ensemble de l'armée américaine selon un rapport
Un rapport indique que l'armée américaine prévoit d'intégrer la technologie d'IA de Palantir dans toutes ses branches. L'article a généré 37 points et 24 commentaires sur Hacker News.