Qwen3.8-27B: R9700에서 159 tok/s, Strix Halo에서 64 tok/s 달성
Qwen3.8-27B: 159 tok/s on R9700, 64 tok/s on Strix Halo
핵심 요약
iPad에서 eGPU를 활용해 Qwen3.8-27B 모델을 구동하는 LemonSeed Studio 프로젝트가 놀라운 추론 속도를 기록했습니다.
- iPad eGPU 구동 — Thunderbolt 인클로저와 AMD GPU를 활용해 iPad에서 고성능 추론을 구현함
- LemonSeed Engine — 그래프 기반 연산 융합과 커널 최적화로 플랫폼 간 일관된 성능을 제공함
- 추론 성능 기록 — Qwen3.8-27B 모델에서 초당 159 토큰이라는 압도적인 속도를 달성함
- 기술적 확장성 — DFlash2 드래프트 트리와 Strix Halo 최적화로 효율적인 토큰 생성 지원
LemonSeed Studio는 썬더볼트 인클로저에 담긴 AMD GPU를 활용해 기기 내에서 추론을 돌리는 아이패드용 에디터이자 IDE야. 수정되지 않은 업스트림 리눅스 amdgpu + amdkfd 드라이버(mac_linuxgpu)를 PCIDriverKit 익스텐션으로 박아 넣었고, 그 위에서 LemonSeed Engine(LSE)을 GPU로 돌리는 방식이지. 사진에 나온 건 아이패드 프로 + Sapphire Radeon AI PRO R9700 조합이고, Qwen3.8-27B Q4 모델에 Q8 DFlash2 드래프트를 얹어서 131k 컨텍스트로 돌린 거야.
LSE는 리눅스, macOS, iPadOS 어디서든 똑같이 돌아가는 엔진이야. 모델의 포워드 패스를 그래프로 기록하고, 연산을 합친 뒤 해당 GPU에 맞는 커널을 직접 생성해. 커널 레이아웃이 여러 개면 기기에서 일일이 측정해보고 제일 빠른 걸로 골라 쓰지. 추론 가속(Speculative decoding, MTP 및 DFlash2)은 측정된 수락률과 비용을 계산해서 드래프트 토큰을 몇 개나 검증할지 알아서 결정해.
디코드, 코드 프롬프트, Qwen3.8-27B Q4 (기준값 / MTP=3 / DFlash2 tok/s):
- R9700 on iPadOS (LemonSeed Studio): 31.2 / 108.7 / 158.5
- R9700 on macOS: 32.2 / 111.9 / 159.4
- R9700 on Linux: 32.0 / 111.0 / 144.6
- Strix Halo (Radeon 8060S) on Linux: 14.0 / 47.8 / 64.4
4K 토큰 프리필 속도: 1,636 (iPadOS), 1,634 (macOS), 1,418 (Linux R9700), 517 (Strix Halo). 32K에서도 성능은 그대로 유지돼: 1,395 / 1,401 / 1,226 / 462.


