Résultats de référence : Modèles Qwen3.5 sur silicium Apple vs GPU AMD avec ROCm vs Vulkan

Configuration matérielle et logicielle
Le benchmark a comparé trois systèmes : un MacBook Pro avec Apple M5 Max (48 Go de mémoire unifiée), un Mac Studio avec Apple M1 Max (64 Go de mémoire unifiée), et un serveur GPU Fedora 43 avec processeur Intel Core Ultra 7 265K et trois GPU AMD : Radeon Pro W7900 (48 Go, RDNA 3), Radeon AI PRO R9700 (32 Go, RDNA 4) et Radeon Pro W6800 (32 Go, RDNA 2). La carte mère offrait des connexions électriques x8/x8/x4, avec le W6800 sur un slot x4 connecté au chipset limité par le lien DMI.
Moteurs d'inférence et modèles
Les systèmes Apple utilisaient mlx-lm (versions 0.31.1 et 0.31.0). Le serveur Fedora exécutait llama.cpp avec les builds HIP/ROCm (b5065) et AMDVLK Vulkan (b5065). La version ROCm était 7.2, la version AMDVLK était 2025.Q2.1. Toutes les exécutions Fedora utilisaient un seul GPU sauf le modèle 122B qui utilisait W7900 + R9700 avec --split-mode layer.
Les modèles testés étaient Qwen3.5-35B-A3B MoE (3B paramètres actifs, mlx-community 4-bit ou unsloth Q4_K_M), Qwen3.5-27B dense (27B paramètres, mlx-community 4-bit ou unsloth Q4_K_M), et Qwen3.5-122B-A10B MoE (10B paramètres actifs, unsloth Q3_K_XL).
Méthodologie de benchmark
Le benchmark reflétait des cas d'usage d'analyse de données de pharmacovigilance : écriture de scripts d'extraction, raisonnement sur des données cliniques, génération de récits réglementaires, et extraction de données structurées à partir de textes cliniques. Les prompts étaient spécifiques au domaine, pas des benchmarks LLM généraux.
Le benchmark standard utilisait un contexte de 8K avec 7 prompts : 2 tests de traitement de prompt (entrée courte ~27 tokens et longue ~2,9K tokens avec sortie minimale pour isoler la vitesse de préremplissage) et 5 tâches de génération (codage court, codage moyen, raisonnement mathématique, écriture de récit de sécurité réglementaire, extraction structurée d'événements indésirables). Utilisateur unique, requête unique, température 0.3, /no_think pour désactiver le mode réflexion, pas de mise en cache de prompt entre les requêtes.
Le benchmark d'échelle de contexte utilisait le même modèle et GPU avec des prompts progressivement plus grands (512 à 16K+ tokens) composés de listes synthétiques d'événements indésirables, avec seulement 64 tokens de sortie maximum pour isoler comment le traitement de prompt et la génération évoluent avec la taille d'entrée.
Principales conclusions
Le benchmark a révélé des résultats intéressants entre ROCm et AMDVLK Vulkan, incluant des tests d'échelle de contexte montrant quand chaque backend performe le mieux. La source note que la plupart des comparaisons disponibles n'aident pas à décider entre des configurations comme un ordinateur portable M5 Max et une station de travail W7900, ou si ROCm vaut la peine de surmonter les difficultés d'installation par rapport à Vulkan.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Les Agents OpenClaw s'affrontent dans la Ligue Pokémon Rouge réservée à l'IA
Une nouvelle plateforme appelée AgentMonLeague permet aux agents autonomes OpenClaw de se connecter à un émulateur de Pokémon Rouge, de prendre leurs propres décisions tout au long d'une partie complète et de concourir pour finir le jeu en premier. Les parties sont visibles en direct à mesure que les agents progressent.

Exclusion systématique des utilisateurs de Claude dans la recherche en psychologie de l'IA – Une lacune méthodologique
Un examen de dizaines d'articles de psychologie sur l'utilisation des chatbots IA révèle que les utilisateurs de Claude ne sont jamais échantillonnés en tant que groupe distinct, malgré des profils d'utilisation et une conception de modèle fondamentalement différents par rapport aux utilisateurs de ChatGPT, Character.AI ou Replika.

Claude Max Données d'utilisation de l'abonnement de 100 $ pour la tâche d'extension d'API
Un utilisateur de l'abonnement Claude Max à 100 $ rapporte avoir consommé 13 % d'une session de 5 heures pour étendre une API existante avec une fonctionnalité de bibliothèque favorite, avec une utilisation du contexte à 11 % et une utilisation hebdomadaire passant de 5 % à 6 %.
Revenus IA de Microsoft : 70 % liés à OpenAI — Analyse des risques
Les documents de Microsoft montrent qu'environ 70 % de ses revenus liés à l'IA proviennent d'OpenAI. L'analyse de Bloomberg met en évidence le risque de cette concentration alors qu'OpenAI perd des milliards chaque année.