Resultados de Benchmark: Modelos Qwen3.5 em Apple Silicon vs GPUs AMD com ROCm vs Vulkan

✍️ OpenClawRadar📅 Publicado: March 26, 2026🔗 Source
Resultados de Benchmark: Modelos Qwen3.5 em Apple Silicon vs GPUs AMD com ROCm vs Vulkan
Ad

Configuração de Hardware e Software

O benchmark comparou três sistemas: um MacBook Pro com Apple M5 Max (48GB de memória unificada), um Mac Studio com Apple M1 Max (64GB de memória unificada) e um servidor GPU Fedora 43 com processador Intel Core Ultra 7 265K e três GPUs AMD: Radeon Pro W7900 (48GB, RDNA 3), Radeon AI PRO R9700 (32GB, RDNA 4) e Radeon Pro W6800 (32GB, RDNA 2). A placa-mãe fornecia conexões elétricas x8/x8/x4, com a W6800 em um slot x4 conectado ao chipset limitado pelo link DMI.

Mecanismos de Inferência e Modelos

Os sistemas Apple usaram mlx-lm (versões 0.31.1 e 0.31.0). O servidor Fedora executou llama.cpp com ambas as compilações HIP/ROCm (b5065) e AMDVLK Vulkan (b5065). A versão ROCm era 7.2, a versão AMDVLK era 2025.Q2.1. Todas as execuções no Fedora usaram uma única GPU, exceto o modelo 122B que usou W7900 + R9700 com --split-mode layer.

Os modelos testados foram Qwen3.5-35B-A3B MoE (3B parâmetros ativos, mlx-community 4-bit ou unsloth Q4_K_M), Qwen3.5-27B denso (27B parâmetros, mlx-community 4-bit ou unsloth Q4_K_M) e Qwen3.5-122B-A10B MoE (10B parâmetros ativos, unsloth Q3_K_XL).

Ad

Metodologia do Benchmark

O benchmark refletiu casos de uso de análise de dados de farmacovigilância: escrever scripts de extração, raciocinar sobre dados clínicos, gerar narrativas regulatórias e extração estruturada de dados de texto clínico. Os prompts eram específicos do domínio, não benchmarks de LLM de propósito geral.

O benchmark padrão usou contexto de 8K com 7 prompts: 2 testes de processamento de prompt (entrada curta ~27 tokens e longa ~2.9K tokens com saída mínima para isolar a velocidade de preenchimento) e 5 tarefas de geração (codificação curta, codificação média, raciocínio matemático, escrita de narrativa de segurança regulatória, extração estruturada de AE). Usuário único, requisição única, temperatura 0.3, /no_think para desativar o modo de pensamento, sem cache de prompt entre requisições.

O benchmark de escalonamento de contexto usou o mesmo modelo e GPU com prompts progressivamente maiores (512 a 16K+ tokens) consistindo de listagens sintéticas de eventos adversos, com apenas 64 tokens de saída máxima para isolar como o processamento de prompt e geração escalam com o tamanho da entrada.

Principais Descobertas

O benchmark revelou descobertas interessantes sobre ROCm vs AMDVLK Vulkan, incluindo testes de escalonamento de contexto mostrando quando cada backend tem melhor desempenho. A fonte observa que a maioria das comparações disponíveis não ajuda a decidir entre configurações como um laptop M5 Max e uma estação de trabalho W7900, ou se o ROCm vale o trabalho de configuração em relação ao Vulkan.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Meta OpenEnv AI Hackathon na Índia Oferece Entrevistas Diretas e Prêmio de US$ 30 Mil
News

Meta OpenEnv AI Hackathon na Índia Oferece Entrevistas Diretas e Prêmio de US$ 30 Mil

A Meta está organizando o primeiro Hackathon OpenEnv AI da Índia em colaboração com a Hugging Face e a PyTorch, onde desenvolvedores construirão ambientes de aprendizado por reforço para agentes de IA. As melhores equipes recebem entrevistas diretas com as equipes de IA da Meta e da Hugging Face, além de um prêmio total de US$ 30.000.

OpenClawRadar
Perspectivas do Projeto Rust sobre IA: Insights Práticos dos Contribuidores
News

Perspectivas do Projeto Rust sobre IA: Insights Práticos dos Contribuidores

Um documento de resumo coleta perspectivas de contribuidores do Rust sobre o uso de ferramentas de IA, destacando que uma integração eficaz de IA requer engenharia cuidadosa e mostrando casos de uso específicos como navegação em bases de código, assistência em revisão de código e processamento de dados semiestruturados.

OpenClawRadar
Auditoria de Ontário: 60% dos sistemas de IA para transcrição confundem medicamentos, 85% perdem detalhes de saúde mental
News

Auditoria de Ontário: 60% dos sistemas de IA para transcrição confundem medicamentos, 85% perdem detalhes de saúde mental

Auditores de Ontário descobriram que 12 de 20 sistemas de IA para anotações médicas inseriram informações incorretas sobre medicamentos, 9 fabricaram sugestões de tratamento e 17 perderam detalhes importantes de saúde mental de gravações de consultas médico-paciente. A avaliação ponderou a precisão em apenas 4% da pontuação total.

OpenClawRadar
Anthropic adquire Stainless por mais de $300M — Agora possui o gerador de servidor MCP dominante
News

Anthropic adquire Stainless por mais de $300M — Agora possui o gerador de servidor MCP dominante

Anthropic comprou a Stainless, geradora de SDKs, por mais de US$ 300 milhões. A Stainless gera a maioria dos servidores MCP de produção a partir de especificações OpenAPI. O produto hospedado está sendo descontinuado; novas inscrições foram interrompidas na segunda-feira.

OpenClawRadar