hipEngine: Inferencia Rápida Nativa de Qwen 3.6 para RDNA3 (Strix Halo, 7900 XTX)

✍️ OpenClawRadar📅 Publicado: 25 de mayo de 2026🔗 Source
hipEngine: Inferencia Rápida Nativa de Qwen 3.6 para RDNA3 (Strix Halo, 7900 XTX)
Ad

Ha aparecido un nuevo motor de inferencia nativo de ROCm para modelos MoE y densos de Qwen 3.6: hipEngine, del desarrollador detrás de FastDMS y ParoQuant. Está basado en Python con rutas críticas en HIP/C++, utilizando librerías nativas de AMD como hipBLASLt, hipGraph y AOTriton. Sin dependencia pesada de PyTorch.

Hardware objetivo

  • gfx1100 — Radeon RX 7900 XTX / Radeon Pro W7900 (RDNA3). Strix Halo también compatible.

Comparativas vs llama.cpp

En Qwen 3.6 35B MoE (usando ParoQuant 4.68 bpw y GGUF Q4_K_S), hipEngine iguala o supera a llama.cpp HIP y Vulkan en todas las longitudes de contexto probadas (512–128K). Números clave (tok/s de prefill, 512 prompt / 128 gen):

  • hipEngine PARO: 2718.497 tok/s
  • hipEngine GGUF Q4_K_S: 2258.847 tok/s
  • llama.cpp HIP: 2436.049 tok/s
  • llama.cpp Vulkan: 1816.927 tok/s

Con contexto de 128K, hipEngine PARO alcanza 1055 tok/s de prefill frente a los 710 tok/s de llama.cpp HIP, una mejora del 48%. Los tok/s de decodificación son similares (rango de 60–127 tok/s).

Ad

Eficiencia de memoria

hipEngine usa caché KV INT8 casi sin pérdidas y prácticamente sin penalización de velocidad. Esto permite ejecutar la ventana de contexto completa de 256K de Qwen 3.6 en menos de 24 GB en una sola 7900 XTX:

  • Contexto 128K, KV BF16: pico muestreado 21.04 GiB, prefill 1091.9 tok/s, decodificación 62.2 tok/s
  • Contexto 128K, KV INT8: pico muestreado 19.80 GiB, prefill 1076.5 tok/s, decodificación 60.0 tok/s
  • Pico de memoria a 128K (hipEngine PARO): 22.122 GiB vs llama.cpp HIP 23.605 GiB

Características

  • Código abierto AGPLv3
  • Nativo ROCm, sin dependencia de PyTorch en rutas críticas
  • Usa hipBLASLt, hipGraph, AOTriton
  • ParoQuant portado a ROCm
  • Caché KV INT8 (casi sin pérdidas, impacto mínimo en velocidad)
  • Compatible con modelos MoE y densos de Qwen 3.6

Si estás ejecutando Qwen 3.6 en hardware RDNA3, vale la pena echarle un vistazo a hipEngine, especialmente para casos de uso con contexto de 256K con limitaciones de memoria.

📖 Lee la fuente original: r/LocalLLaMA

Ad

👀 Ver también

Panel Lateral Persistente para Claude Code con Gestión Autónoma de Contenido
Herramientas

Panel Lateral Persistente para Claude Code con Gestión Autónoma de Contenido

Un desarrollador creó un panel TUI que se ubica en un panel dividido de iTerm2 junto al terminal, con tres paneles fijos que Claude gestiona de forma autónoma para mostrar contenido relevante como código, diagramas y actualizaciones de estado.

OpenClawRadar
IronBee: Capa de verificación de código abierto para Claude Code y Cursor
Herramientas

IronBee: Capa de verificación de código abierto para Claude Code y Cursor

IronBee es una capa de verificación de código abierto que obliga a los agentes de codificación con IA a probar los cambios en un navegador real antes de completar las tareas. En las pruebas, detectó errores en el 82% de las sesiones de Claude Code que se habrían enviado sin verificación.

OpenClawRadar
Habilidad de prueba de SwiftUI de código abierto para Claude Code utiliza Computer Use para probar aplicaciones visualmente.
Herramientas

Habilidad de prueba de SwiftUI de código abierto para Claude Code utiliza Computer Use para probar aplicaciones visualmente.

Una habilidad de código abierto llamada /ios-test prueba visualmente aplicaciones SwiftUI utilizando la capacidad de Uso de Computadora. El agente encuentra archivos .xcodeproj, construye la aplicación en un Simulador, luego navega por cada pantalla, tocando botones y siguiendo enlaces como un usuario real.

OpenClawRadar
VidLens Servidor MCP: Base de Conocimiento Persistente de YouTube para Claude
Herramientas

VidLens Servidor MCP: Base de Conocimiento Persistente de YouTube para Claude

VidLens es un servidor MCP gratuito y de código abierto que indexa contenido de YouTube localmente con incrustaciones semánticas, tratando los videos como una base de conocimiento persistente en lugar de extraer transcripciones temporales. Proporciona 41 herramientas en 10 módulos para buscar, analizar y recuperar contenido de video.

OpenClawRadar