hipEngine: RDNA3(Strix Halo, 7900 XTX)를 위한 빠른 네이티브 Qwen 3.6 추론 엔진
hipEngine: Fast Native Qwen 3.6 Inference for RDNA3 (Strix Halo, 7900 XTX)
핵심 요약
AMD RDNA3 GPU에서 Qwen 3.6 모델의 추론 속도를 극대화하는 ROCm 기반의 새로운 오픈소스 엔진 hipEngine을 소개합니다.
- ROCm 네이티브 지원 — PyTorch 의존성 없이 HIP/C++로 작성되어 AMD GPU에서 최적화된 성능을 제공함.
- 압도적인 Prefill 성능 — 7900 XTX 환경에서 기존 llama.cpp 대비 훨씬 빠른 프롬프트 처리 속도를 보여줌.
- 메모리 효율성 — INT8 KVCache를 통해 256K 컨텍스트를 24GB 미만의 VRAM에서 구동 가능함.
- GGUF 지원 — 초기 단계지만 GGUF 모델을 지원하여 별도의 학습 없이도 다양한 모델 활용이 가능함.
몇 주 전, FastDMS 작업을 마친 후, Qwen 3.6 MoE를 얼마나 빠르게 돌릴 수 있을지 확인하기 위해 RDNA3 커널을 다시 만지작거리기 시작했습니다. 결과가 꽤 괜찮아서 지난 몇 주 동안 이 실험들을 새로운 오픈소스(AGPLv3) ROCm 네이티브 로컬 LLM 추론 엔진인 hipEngine으로 발전시켰습니다.
Python 기반이지만 무거운 PyTorch 의존성은 없습니다. 모든 핵심 경로는 HIP/C++로 작성되었으며, hipBLASLt, hipGraph, AOTriton 등 AMD 네이티브 라이브러리를 적극적으로 활용합니다.
gfx1100 (Radeon RX 7900 XTX / Radeon Pro W7900)
초기 구현은 Qwen 3.6(MoE 및 dense)을 llama.cpp와 경쟁력 있게 구동하며, ParoQuant(ROCm 호환으로 포팅함) 4.68bpw 모델은 gfx1100(W7900/7900 XTX)에서 512부터 128K까지 모든 테스트된 컨텍스트 길이에서 더 나은 c=1 prefill(프롬프트 처리) 성능을 보여줍니다:
Prefill tok/s
| Workload | hipEngine PARO | hipEngine GGUF Q4_K_S | llama.cpp HIP | llama.cpp Vulkan |
| --- | ---: | ---: | ---: | ---: |
| 512/128 | **2718.497** | 2258.847 | 2436.049 | 1816.927 |
| 4K/128 | **2838.773** | 2576.673 | 2176.905 | 1705.093 |
| 32K/128 | **2074.699** | 1893.967 | 1496.409 | 1128.554 |
| 128K/128 | **1055.454** | 998.143 | 710.213 | 480.539 |
Decode tok/s
| Workload | hipEngine PARO | hipEngine GGUF Q4_K_S | llama.cpp HIP | llama.cpp Vulkan |
| --- | ---: | ---: | ---: | ---: |
| 512/128 | 103.460 | 109.152 | 85.487 | **127.515** |
| 4K/128 | 101.964 | 100.048 | 87.375 | **120.163** |
| 32K/128 | 90.438 | 86.774 | 76.994 | **98.073** |
| 128K/128 | 59.598 | 57.954 | 57.341 | **64.478** |
Peak GiB
| Workload | hipEngine PARO | hipEngine GGUF Q4_K_S | llama.cpp HIP | llama.cpp Vulkan |
| --- | ---: | ---: | ---: | ---: |
| 512/128 | 20.962 | 25.108 | 21.125 | **20.844** |
| 4K/128 | 21.906 | 25.108 | 21.197 | **20.969** |
| 32K/128 | 22.016 | 25.108 | 21.738 | **21.533** |
| 128K/128 | **22.122** | 25.108 | 23.605 | 23.596 |
또한 128K에서 가장 낮은 피크 메모리 사용량을 기록합니다. hipEngine은 거의 손실 없는 INT8 KVCache(속도 저하 거의 없음)를 갖추고 있어, RDNA3에서 좋은 성능으로 24GB 미만(예: 전용 7900 XTX)에서 전체 Qwen 3.6 256K 컨텍스트 윈도우를 실행할 수 있습니다:

