TurboFieldfare를 Qwen 3.6 35B로 포팅해서 1.4GB RAM으로 구동 성공함
I ported TurboFieldfare to Qwen 3.6 35B and it runs in 1.4 GB of RAM
핵심 요약
SSD에서 MoE 전문가를 스트리밍하는 방식으로 Qwen 3.6 35B 모델을 1.4GB RAM 환경에서 구동하는 데 성공했습니다.
- 모델 포팅 — TurboFieldfare 엔진에 Qwen 3.6 35B-A3B 지원 추가함
- 메모리 효율성 — 선형 어텐션 활용으로 Gemma보다 적은 1.4GB RAM 사용
- 성능 분석 — SSD 스트리밍 방식으로 인해 M5 기기에서 19~23 tok/s 속도 기록
- 오픈 소스 기여 — PR 제출 및 빌드 가능한 브랜치 공개
TurboFieldfare를 가지고 놀고 있었는데, 이건 Gemma 4 26B를 모델을 전부 로드하는 대신 SSD에서 MoE 전문가를 스트리밍하여 약 2GB RAM으로 구동하는 Mac용 엔진입니다. 기존에는 해당 모델만 지원했기에, 제가 Qwen 3.6 35B-A3B에 대한 지원을 추가했습니다.
비교하자면, Qwen은 메모리가 덜 필요합니다. Gemma는 약 2.1GB인데 반해 Qwen은 약 1.4GB 정도입니다. Qwen의 전문가는 크기가 절반이고 40개 레이어 중 30개가 선형 어텐션을 사용합니다. 그래서 유지해야 할 KV 캐시가 급격히 줄어듭니다.
제 M5 기기에서의 속도는 프롬프트 길이에 따라 19~23 tok/s입니다. 같은 기기에서 Gemma는 31~35 tok/s가 나옵니다. Qwen이 더 느린 이유는 18GB에 달하는 전문가 데이터가 OS 페이지 캐시에 다 들어가지 않아서, 실제로는 SSD 읽기 작업이 더 많이 발생하기 때문입니다.
또한 기기를 8GB 워킹 세트로 고정해 보았는데 아무런 차이가 없었습니다. 22.9 tok/s가 나왔고 출력값도 바이트 단위까지 동일했는데, 어차피 디스크에서 스트리밍 중이라 예상했던 결과입니다.
PR은 업스트림에 열려 있습니다: drumih/turbo-fieldfare#29
빌드하고 싶으신 분들을 위한 브랜치: NeelM0906/turbo-fieldfare@qwen36-support
참고: 텍스트 전용이며 4K 컨텍스트에서 테스트했고, 약 20GB의 디스크 공간이 필요합니다. 그리고 제 8GB 테스트는 시뮬레이션된 메모리 압박 환경이었으며 실제 8GB Mac은 아닙니다.



