hipEngine: RDNA3용 빠른 네이티브 Qwen 3.6 추론 (Strix Halo, 7900 XTX)

✍️ OpenClawRadar📅 게시일: May 25, 2026🔗 Source
hipEngine: RDNA3용 빠른 네이티브 Qwen 3.6 추론 (Strix Halo, 7900 XTX)
Ad

Qwen 3.6 MoE 및 밀집 모델을 위한 새로운 ROCm 네이티브 추론 엔진인 hipEngine이 등장했습니다. FastDMS와 ParoQuant의 개발자가 제작했으며, Python 기반에 핫 패스는 HIP/C++로 작성되어 AMD 네이티브 라이브러리(hipBLASLt, hipGraph, AOTriton)를 사용합니다. 무거운 PyTorch 의존성이 없습니다.

대상 하드웨어

  • gfx1100 — Radeon RX 7900 XTX / Radeon Pro W7900 (RDNA3). Strix Halo도 지원.

llama.cpp 대비 벤치마크

Qwen 3.6 35B MoE(ParoQuant 4.68 bpw 및 GGUF Q4_K_S 사용)에서 hipEngine은 모든 테스트 컨텍스트 길이(512–128K)에서 llama.cpp HIP 및 Vulkan과 동등하거나 더 나은 성능을 보입니다. 주요 수치(프리필 tok/s, 512 프롬프트 / 128 생성):

  • hipEngine PARO: 2718.497 tok/s
  • hipEngine GGUF Q4_K_S: 2258.847 tok/s
  • llama.cpp HIP: 2436.049 tok/s
  • llama.cpp Vulkan: 1816.927 tok/s

128K 컨텍스트에서 hipEngine PARO 프리필은 1055 tok/s로, llama.cpp HIP의 710 tok/s보다 48% 향상되었습니다. 디코드 tok/s는 비슷합니다(60–127 tok/s 범위).

Ad

메모리 효율성

hipEngine은 거의 손실 없는 INT8 KV 캐시를 사용하며 속도 저하가 거의 없습니다. 이를 통해 단일 7900 XTX에서 24GB 미만으로 Qwen 3.6의 256K 컨텍스트 윈도우를 실행할 수 있습니다:

  • 128K 컨텍스트, BF16 KV: 샘플 최고 21.04 GiB, 프리필 1091.9 tok/s, 디코드 62.2 tok/s
  • 128K 컨텍스트, INT8 KV: 샘플 최고 19.80 GiB, 프리필 1076.5 tok/s, 디코드 60.0 tok/s
  • 128K에서 최대 메모리 (hipEngine PARO): 22.122 GiB vs llama.cpp HIP 23.605 GiB

기능

  • AGPLv3 오픈소스
  • ROCm 네이티브, 핫 패스에 PyTorch 의존성 없음
  • hipBLASLt, hipGraph, AOTriton 사용
  • ParoQuant를 ROCm에 이식
  • INT8 KV 캐시 (거의 손실 없음, 속도 영향 최소화)
  • Qwen 3.6 MoE 및 밀집 모델 지원

RDNA3 하드웨어에서 Qwen 3.6을 실행 중이라면, 특히 메모리가 제한된 256K 컨텍스트 사용 사례에서 hipEngine을 살펴볼 가치가 있습니다.

📖 원문 보기: r/LocalLLaMA

Ad

👀 See Also

Claude Desktop + Blender via MCP: 실시간 3D 워크플로가 피드백 루프를 완성하다
Tools

Claude Desktop + Blender via MCP: 실시간 3D 워크플로가 피드백 루프를 완성하다

오픈소스 블렌더 애드온이 블렌더 내에서 MCP 서버를 실행하여, Claude Desktop이 장면을 검사하고, 객체를 생성하고, 이미지를 렌더링하고, 결과를 읽을 수 있게 합니다. 스크립트 복사-붙여넣기 피드백 루프를 없애줍니다.

OpenClawRadar
Nit: AI 에이전트 토큰 효율성을 위해 최적화된 Zig 언어 기반 Git 대체 도구
Tools

Nit: AI 에이전트 토큰 효율성을 위해 최적화된 Zig 언어 기반 Git 대체 도구

Nit는 Zig로 작성된 네이티브 Git 대체 도구로, status, diff, log, show와 같은 일반적인 명령어에서 토큰 사용량을 35-87% 감소시킵니다. 이는 간결한 출력 기본값과 직접적인 libgit2 통합을 통해 하위 프로세스 오버헤드를 제거함으로써 달성됩니다.

OpenClawRadar
Claude AI를 위한 시각적 프롬프트 프레임워크, 텍스트 프롬프트를 단일 이미지로 대체하다
Tools

Claude AI를 위한 시각적 프롬프트 프레임워크, 텍스트 프롬프트를 단일 이미지로 대체하다

수용 능력 원칙 v9는 Claude AI를 위한 단일 플로우차트 이미지를 텍스트 프롬프트 대신 사용하는 양방향 구조적 프레임워크입니다. 시스템 매개변수나 목표에 따라 구조적 진단이나 생성적 구축 계획을 제공합니다.

OpenClawRadar
언더스터디: 데모를 통해 작업을 학습하는 가르칠 수 있는 데스크톱 에이전트
Tools

언더스터디: 데모를 통해 작업을 학습하는 가르칠 수 있는 데스크톱 에이전트

언더스터디는 GUI 애플리케이션, 브라우저, 쉘 도구, 파일, 메시징을 하나의 세션에서 운영할 수 있는 로컬 퍼스트 데스크톱 에이전트 런타임입니다. 작업을 한 번 시연하면, 화면 비디오와 의미론적 이벤트를 기록하고, 좌표가 아닌 의도를 추출하여 재사용 가능한 스킬로 변환합니다.

OpenClawRadar