Warpdrv - Strix Halo + RTX Pro에서 Qwen 35b/27b를 구동하기 위한 오픈소스 Llama.cpp 런처
Warpdrv - my open-source Llama.cpp launcher for daily-driving Qwen 35b + 27b on Strix Halo + RTX Pro.
핵심 요약
Strix Halo와 RTX Pro 환경에서 로컬 LLM을 효율적으로 구동하는 오픈소스 런처 Warpdrv를 소개함.
- 오픈소스 런처 — 로컬 LLM 구동을 위한 편리한 llama-server 인스턴스 관리 도구임.
- 하드웨어 최적화 — Strix Halo와 RTX Pro 5000을 활용한 고성능 로컬 환경 구성함.
- 고급 기능 — MCP, 모델 라우터, KV-캐시 체크포인팅 등 다양한 편의 기능 제공함.
- ROCm 설정 가이드 — Ubuntu 25.10에서 Strix Halo를 위한 상세한 ROCm 설정법 공유함.
내 시스템에서 로컬로 LLM을 실행하기 위해 직접 만든 오픈소스 앱을 공유하고 싶어.
내 시스템
하드웨어
- FEVM FAEX1 (128GB)
- RTX Pro 5000 Blackwell (48GB), OCuLink로 연결
- Aoostar AG02
mdadm을 사용한 RAID-0 구성의 2x2TB 내장 m.2 드라이브
소프트웨어: Ubuntu 25.10, CUDA + Vulkan, ROCm을 위해 소스에서 빌드한 llama.cpp.
앱 사용 방법
나는 보통 서로 다른 Llama 백엔드를 사용하여 두 개의 모델을 동시에 실행해. CUDA에서는 Qwen3.6 27b UD-Q6-KXL 또는 NVFP4를, Strix Halo 통합 메모리에서는 Qwen3.6 35b A3B UD-Q6-KXL을 돌리지. 주로 코딩용으로 사용하는데, 내장된 모델 라우터가 꽤 유용해.
앱의 다른 기능
다른 llama.cpp 래퍼들이 할 수 있는 기본적인 기능들과 몇 가지 추가 기능을 제공해. 전반적으로 llama-server 인스턴스를 어떤 목적이든 쉽게 띄울 수 있게 해주는 편의 앱이야. 오픈소스이기도 하고.
- MCP.json + 채팅 내 툴 호출
- opencode / claude-code 로컬용 모델 라우터
- KV-캐시 체크포인팅 (실험적)
더 자세한 정보는 Read Me와 가이드에서 확인할 수 있어.
초기 알파 릴리스라 사소한 버그가 있을 수 있어. 주요 버그는 대부분 잡았지만, 기능 요청이나 버그 리포트는 언제든 환영이야.
Strix Halo에서 ROCm 설정하기 (Ubuntu 25.10)
Linux의 Strix Halo는 gfx1151에서 ROCm이 네이티브로 작동하려면 약간의 설정이 필요해. Strix Halo용 Docker 기반 툴박스가 있다는 건 알지만, 나는 컨테이너 없이 베어메탈 환경을 원했어.
