VMs macOS com Apple Silicon: Inferência de LLM 11–16× mais rápida com Shim de Capacidade Metal
Cua — a equipe por trás da pilha de virtualização macOS Lume — lançou um projeto de pesquisa que corrige consultas de capacidade Metal dentro de VMs macOS, desbloqueando kernels de GPU mais novos. O resultado: llama.cpp roda 11–16× mais rápido em uma VM macOS no Apple Silicon, quase igualando o desempenho em hardware nativo.
Como funciona
O Virtualization.framework da Apple apresenta aos convidados macOS uma GPU paravirtualizada. O driver Metal do convidado relata um perfil de capacidade conservador — em VMs Tahoe padrão, ele relata uma família de GPU da era Apple 5, memória limitada de threadgroup, e sem suporte a matriz SIMD-group. O llama.cpp vê esses limites e escolhe kernels mais lentos, mesmo que a GPU física possa lidar com mais.
O shim da Cua intercepta consultas de capacidade Metal em um único processo convidado e retorna valores atualizados. Isso permite que o llama.cpp selecione kernels Metal mais novos sem alterar o sistema operacional convidado ou o hipervisor.
Benchmarks
- TinyLlama 1.1B (M1 Ultra): processamento de prompt 11.08× mais rápido, geração de tokens 16.36× mais rápido vs VM padrão. O processamento de prompt atingiu 98% do desempenho em hardware nativo.
- Gemma 4 12B QAT Q4_0 (6.98 GB): prompts 7.20× mais rápidos, geração 14.54× mais rápida. Alcançou 99.59% da velocidade de prompt nativa, 94.82% da geração.
- Muse Glimmer 30B Q4_K-M GGUF (convidado de 64 GiB, llama.cpp b10359): processamento de prompt 7.55× mais rápido, geração 8.87× mais rápida em um prompt de 512 tokens.
Por que isso importa
Isso não é um passthrough de GPU no sentido VFIO — o host ainda possui a GPU. Mas corrige um relatório incorreto de capacidade que forçava a seleção conservadora de kernels. Usuários do Tart registraram um problema semelhante sobre gráficos e desempenho de LLM em convidados macOS.
O shim tem escopo de processo, então afeta apenas o aplicativo alvo. Tudo é lançado sob a mesma licença permissiva do Lume e Cua, com código-fonte, scripts de build e logs de benchmark incluídos.
Para quem é
Desenvolvedores que executam llama.cpp ou outra inferência baseada em Metal dentro de VMs macOS no Apple Silicon — especialmente aqueles que constroem ferramentas de IA locais ou testam contra imagens de VM.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

Geração de SVG com Arnês de Loop Fechado Qwen3.6-27B
Um circuito fechado usando agentes Agno e Pi melhora iterativamente as saídas SVG do Qwen3.6-27B renderizando, realimentando PNGs para o Qwen Vision e avaliando resultados em duas rodadas.

Claude Code v2.1.144: Sessões em Segundo Plano, Escopo de /model e Timeout de Inicialização de 15s
O Claude Code v2.1.144 adiciona /resume para sessões em segundo plano, limita /model à sessão atual e corrige uma parada de 75s na inicialização quando api.anthropic.com está inacessível com um timeout de 15s.

Como criei um site de rolagem 3D em 2 horas usando Claude Code e Veo
Um desenvolvedor criou um site com rolagem 3D em 2 horas usando Claude Code, geração de vídeo Veo e uma habilidade personalizada de 'vídeo para site'. Código completo e demonstração ao vivo compartilhados.

AI Chat Exporter: Uma Extensão do Chrome para Conversas do Claude em PDF de Alta Fidelidade
Um desenvolvedor criou o AI Chat Exporter, uma extensão do Chrome que preserva matemática, código e imagens ao exportar conversas do Claude para PDF. A ferramenta utiliza um mecanismo de renderização baseado no navegador, desenvolvido com o Claude 3.5 Sonnet, para lidar com formatação progressiva de markdown e LaTeX.