hipEngine: Inferência Nativa Rápida do Qwen 3.6 para RDNA3 (Strix Halo, 7900 XTX)

Um novo mecanismo de inferência nativo ROCm para modelos MoE e densos Qwen 3.6 surgiu: hipEngine, do desenvolvedor por trás do FastDMS e ParoQuant. É baseado em Python com caminhos críticos em HIP/C++, usando bibliotecas nativas da AMD como hipBLASLt, hipGraph e AOTriton. Sem dependência pesada do PyTorch.
Hardware Alvo
gfx1100— Radeon RX 7900 XTX / Radeon Pro W7900 (RDNA3). Strix Halo também suportado.
Benchmarks vs llama.cpp
No Qwen 3.6 35B MoE (usando ParoQuant 4,68 bpw e GGUF Q4_K_S), o hipEngine iguala ou supera o llama.cpp HIP e Vulkan em todos os tamanhos de contexto testados (512–128K). Números principais (prefill tok/s, 512 prompt / 128 geração):
- hipEngine PARO: 2718,497 tok/s
- hipEngine GGUF Q4_K_S: 2258,847 tok/s
- llama.cpp HIP: 2436,049 tok/s
- llama.cpp Vulkan: 1816,927 tok/s
No contexto de 128K, o prefill do hipEngine PARO atinge 1055 tok/s contra 710 tok/s do llama.cpp HIP — uma melhoria de 48%. Os tok/s de decodificação são comparáveis (faixa de 60–127 tok/s).
Eficiência de Memória
O hipEngine usa cache KV INT8 quase sem perdas e com quase nenhuma penalidade de velocidade. Isso permite executar a janela de contexto completa de 256K do Qwen 3.6 em menos de 24 GB em uma única 7900 XTX:
- Contexto 128K, KV BF16: pico amostrado 21,04 GiB, prefill 1091,9 tok/s, decode 62,2 tok/s
- Contexto 128K, KV INT8: pico amostrado 19,80 GiB, prefill 1076,5 tok/s, decode 60,0 tok/s
- Pico de memória em 128K (hipEngine PARO): 22,122 GiB vs llama.cpp HIP 23,605 GiB
Recursos
- Código aberto AGPLv3
- Nativo ROCm, sem dependência do PyTorch no caminho crítico
- Usa hipBLASLt, hipGraph, AOTriton
- ParoQuant portado para ROCm
- Cache KV INT8 (quase sem perdas, impacto mínimo na velocidade)
- Suporta modelos MoE e densos Qwen 3.6
Se você está executando o Qwen 3.6 em hardware RDNA3, vale a pena dar uma olhada no hipEngine — especialmente para casos de uso com contexto de 256K com restrição de memória.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

cstat: Uma Barra de Status Nativa em Rust para Claude Code com Desempenho de 2ms
cstat é um binário nativo em Rust que substitui a linha de status de 62ms do claude-hud por uma implementação de 2ms, eliminando 24 inicializações de subprocessos por execução. Ele exibe informações do modelo, limites de taxa, status do git, uso da janela de contexto, ferramentas ativas, subagentes e progresso de tarefas.
Tendril: Um agente autoextensível que constrói e registra ferramentas em tempo real
Tendril é um sandbox agentivo que descobre, constrói e registra ferramentas de forma autônoma. Ele começa com apenas três ferramentas de inicialização e expande dinamicamente seu registro de capacidades sem perguntar ao usuário.

Stackdome: Alternativa Open Source e Auto-hospedável ao Railway no Kubernetes
Stackdome é uma plataforma de implantação de código aberto e auto-hospedável que empacota ferramentas do CNCF em uma experiência de desenvolvedor opinativa, semelhante à Railway, em Kubernetes. Possui interface de canvas, suporte a múltiplos clusters, Postgres gerenciado e builds de source-to-image.

Benchmark de Criatividade Humana: Separando Convergência de Divergência na Avaliação Criativa de IA
Contra Labs apresenta o Human Creativity Benchmark (HCB), uma estrutura que distingue critérios objetivamente verificáveis (ex.: aderência ao prompt) do gosto subjetivo (ex.: apelo visual) na avaliação de IA generativa para trabalho criativo. O benchmark revela que nenhum modelo atual é confiavelmente correto e orientável, abordando o colapso de modo e a necessidade de saída diferenciada.