Résultats de référence : Modèles Qwen3.5 sur silicium Apple vs GPU AMD avec ROCm vs Vulkan

✍️ OpenClawRadar📅 Publié: March 26, 2026🔗 Source
Résultats de référence : Modèles Qwen3.5 sur silicium Apple vs GPU AMD avec ROCm vs Vulkan
Ad

Configuration matérielle et logicielle

Le benchmark a comparé trois systèmes : un MacBook Pro avec Apple M5 Max (48 Go de mémoire unifiée), un Mac Studio avec Apple M1 Max (64 Go de mémoire unifiée), et un serveur GPU Fedora 43 avec processeur Intel Core Ultra 7 265K et trois GPU AMD : Radeon Pro W7900 (48 Go, RDNA 3), Radeon AI PRO R9700 (32 Go, RDNA 4) et Radeon Pro W6800 (32 Go, RDNA 2). La carte mère offrait des connexions électriques x8/x8/x4, avec le W6800 sur un slot x4 connecté au chipset limité par le lien DMI.

Moteurs d'inférence et modèles

Les systèmes Apple utilisaient mlx-lm (versions 0.31.1 et 0.31.0). Le serveur Fedora exécutait llama.cpp avec les builds HIP/ROCm (b5065) et AMDVLK Vulkan (b5065). La version ROCm était 7.2, la version AMDVLK était 2025.Q2.1. Toutes les exécutions Fedora utilisaient un seul GPU sauf le modèle 122B qui utilisait W7900 + R9700 avec --split-mode layer.

Les modèles testés étaient Qwen3.5-35B-A3B MoE (3B paramètres actifs, mlx-community 4-bit ou unsloth Q4_K_M), Qwen3.5-27B dense (27B paramètres, mlx-community 4-bit ou unsloth Q4_K_M), et Qwen3.5-122B-A10B MoE (10B paramètres actifs, unsloth Q3_K_XL).

Ad

Méthodologie de benchmark

Le benchmark reflétait des cas d'usage d'analyse de données de pharmacovigilance : écriture de scripts d'extraction, raisonnement sur des données cliniques, génération de récits réglementaires, et extraction de données structurées à partir de textes cliniques. Les prompts étaient spécifiques au domaine, pas des benchmarks LLM généraux.

Le benchmark standard utilisait un contexte de 8K avec 7 prompts : 2 tests de traitement de prompt (entrée courte ~27 tokens et longue ~2,9K tokens avec sortie minimale pour isoler la vitesse de préremplissage) et 5 tâches de génération (codage court, codage moyen, raisonnement mathématique, écriture de récit de sécurité réglementaire, extraction structurée d'événements indésirables). Utilisateur unique, requête unique, température 0.3, /no_think pour désactiver le mode réflexion, pas de mise en cache de prompt entre les requêtes.

Le benchmark d'échelle de contexte utilisait le même modèle et GPU avec des prompts progressivement plus grands (512 à 16K+ tokens) composés de listes synthétiques d'événements indésirables, avec seulement 64 tokens de sortie maximum pour isoler comment le traitement de prompt et la génération évoluent avec la taille d'entrée.

Principales conclusions

Le benchmark a révélé des résultats intéressants entre ROCm et AMDVLK Vulkan, incluant des tests d'échelle de contexte montrant quand chaque backend performe le mieux. La source note que la plupart des comparaisons disponibles n'aident pas à décider entre des configurations comme un ordinateur portable M5 Max et une station de travail W7900, ou si ROCm vaut la peine de surmonter les difficultés d'installation par rapport à Vulkan.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Claude Code Opus 4.6 utilise désormais par défaut une fenêtre de contexte de 1 million de tokens
News

Claude Code Opus 4.6 utilise désormais par défaut une fenêtre de contexte de 1 million de tokens

Le modèle Opus 4.6 de Claude Code est désormais doté par défaut d'une fenêtre de contexte d'un million de tokens, tout en conservant les mêmes tarifs que les versions précédentes. Ce changement semble être en vigueur sans annonce officielle.

OpenClawRadar
La fuite du code source de Claude révèle le système de mémoire autoDream et les modèles multi-agents
News

La fuite du code source de Claude révèle le système de mémoire autoDream et les modèles multi-agents

Anthropic a accidentellement livré le code source TypeScript de Claude Code dans les source maps npm, révélant le moteur de consolidation de mémoire autoDream, l'architecture modulaire des prompts système et les modèles de coordination multi-agents.

OpenClawRadar
L'affinage de Phi-4-mini en n'entraînant que les paramètres de LayerNorm ne parvient pas à améliorer les performances.
News

L'affinage de Phi-4-mini en n'entraînant que les paramètres de LayerNorm ne parvient pas à améliorer les performances.

Un amateur a testé l'entraînement uniquement des valeurs γ de LayerNorm sur Phi-4-mini dans les domaines Python et médical avec différents taux d'apprentissage et formats de données. Les performances se sont légèrement dégradées sur tous les benchmarks par rapport à la ligne de base, l'auteur concluant que les transformers acheminent déjà l'information dynamiquement via l'attention.

OpenClawRadar
L'audit des journaux d'API révèle que les agents IA gaspillent des tokens pour l'encombrement de la fenêtre de contexte
News

L'audit des journaux d'API révèle que les agents IA gaspillent des tokens pour l'encombrement de la fenêtre de contexte

Un audit Reddit révèle que les agents Claude brûlent 30 000+ tokens en exploration de fichiers et logs verbeux avant d'écrire du code, provoquant une dégradation architecturale à mesure que le contexte se remplit de bruit.

OpenClawRadar