Resultados de Referencia: Modelos Qwen3.5 en Apple Silicon frente a GPUs AMD con ROCm frente a Vulkan

Configuración de Hardware y Software
La evaluación comparó tres sistemas: un MacBook Pro con Apple M5 Max (48 GB de memoria unificada), un Mac Studio con Apple M1 Max (64 GB de memoria unificada) y un servidor GPU Fedora 43 con procesador Intel Core Ultra 7 265K y tres GPU AMD: Radeon Pro W7900 (48 GB, RDNA 3), Radeon AI PRO R9700 (32 GB, RDNA 4) y Radeon Pro W6800 (32 GB, RDNA 2). La placa base proporcionaba conexiones eléctricas x8/x8/x4, con la W6800 en una ranura x4 conectada al chipset limitada por el enlace DMI.
Motores de Inferencia y Modelos
Los sistemas Apple utilizaron mlx-lm (versiones 0.31.1 y 0.31.0). El servidor Fedora ejecutó llama.cpp con compilaciones HIP/ROCm (b5065) y AMDVLK Vulkan (b5065). La versión de ROCm fue 7.2, la versión de AMDVLK fue 2025.Q2.1. Todas las ejecuciones en Fedora usaron una sola GPU, excepto el modelo 122B que utilizó W7900 + R9700 con --split-mode layer.
Los modelos probados fueron Qwen3.5-35B-A3B MoE (3B parámetros activos, mlx-community 4-bit o unsloth Q4_K_M), Qwen3.5-27B denso (27B parámetros, mlx-community 4-bit o unsloth Q4_K_M) y Qwen3.5-122B-A10B MoE (10B parámetros activos, unsloth Q3_K_XL).
Metodología de Evaluación
La evaluación reflejó casos de uso de análisis de datos de farmacovigilancia: escritura de scripts de extracción, razonamiento sobre datos clínicos, generación de narrativas regulatorias y extracción estructurada de datos de texto clínico. Los prompts fueron específicos del dominio, no evaluaciones generales de LLM.
La evaluación estándar utilizó un contexto de 8K con 7 prompts: 2 pruebas de procesamiento de prompts (entrada corta de ~27 tokens y larga de ~2.9K tokens con salida mínima para aislar la velocidad de prefilling) y 5 tareas de generación (codificación corta, codificación media, razonamiento matemático, escritura de narrativas de seguridad regulatoria, extracción estructurada de AE). Usuario único, solicitud única, temperatura 0.3, /no_think para desactivar el modo de pensamiento, sin caché de prompts entre solicitudes.
La evaluación de escalado de contexto utilizó el mismo modelo y GPU con prompts progresivamente más grandes (512 a 16K+ tokens) que consistían en listados sintéticos de eventos adversos, con solo 64 tokens de salida máxima para aislar cómo escalan el procesamiento de prompts y la generación con el tamaño de entrada.
Hallazgos Clave
La evaluación reveló hallazgos interesantes entre ROCm y AMDVLK Vulkan, incluyendo pruebas de escalado de contexto que muestran cuándo cada backend rinde mejor. La fuente señala que la mayoría de las comparaciones disponibles no ayudan a decidir entre configuraciones como una laptop M5 Max y una estación de trabajo W7900, o si ROCm vale la pena la complicación de configuración sobre Vulkan.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

La Trampa de la Dependencia de la IA: Por qué la Confianza Excesiva en los LLM Puede Erosionar las Habilidades Clave
Un punto de vista contrario que argumenta que la fuerte dependencia de los chatbots de IA provocará la atrofia del pensamiento crítico, la escritura, la investigación y la capacidad de aprendizaje.

Claude MAX Plan Ahora Incluye Ventana de Contexto de 1 Millón de Tokens Sin Costo Adicional
El plan Claude MAX se ha actualizado automáticamente para incluir una ventana de contexto de 1 millón de tokens sin cargos adicionales por uso de API, y los usuarios informan una reducción significativa en el uso de tokens y la eliminación de la sobrecarga de gestión de la ventana de contexto.

Claude Fable 5 de Anthropic: Los benchmarks muestran grandes avances, pero los precios y límites de tasa preocupan a los desarrolladores
Claude Fable 5 llega con fuertes puntos de referencia en codificación y tareas agénticas, pero los desarrolladores están preocupados por los precios de la API y los límites de velocidad.
Startups de IA publican menos investigación: Lo que significa para el código abierto y los desarrolladores
Las principales startups de IA están publicando significativamente menos investigaciones, lo que genera preocupaciones sobre la transparencia y la reproducibilidad en el campo.