Qwen 3.6 35b (MTP 버전)으로 100만 토큰 이상 테스트해 본 후기
Used over a million tokens in three separate sessions to test Qwen 3.6 35b (new Multi-token Prediction version)
핵심 요약
MTP 모델을 활용해 300k 컨텍스트에서 대규모 프로젝트를 테스트한 결과, 로컬 LLM의 성능 향상이 매우 인상적임.
- MTP 모델 성능 — 기존 대비 1.5배 빠른 속도와 대규모 컨텍스트 처리가 가능해짐.
- 테스트 환경 — Ubuntu 24.04와 Vulkan 기반의 llama.cpp 서버를 사용하여 300k 컨텍스트를 구동함.
- 하드웨어 사양 — 32GB VRAM을 탑재한 Asus Radeon R9700 AI Pro 카드를 활용함.
- 모델 변경 사항 — MoE 모델의 컨텍스트 깊이 문제로 인해 Qwen 3.6 27b 모델로 전환함.
제 생각에 MTP 모델은 로컬 LLM의 판도를 완전히 바꾸는 게임 체인저입니다.
속도 측면에서 이전 테스트보다 약 1.5배 빠른 tok/sec를 기록했습니다.
이번 프로젝트는 파이게임(pygame)을 사용하여 단계별로 반복적인 작은 미스터리 던전 스타일 게임을 만드는 테스트였습니다. 처음에는 컨텍스트를 100k~200k로 설정했다가 300k까지 올렸습니다. KV Q8_0 양자화를 적용한 상태입니다. 저는 VSCodium과 Roo를 사용합니다. 컨텍스트 윈도우를 얼마나 밀어붙일 수 있는지, 그리고 다중 파일 프로젝트에서 큰 컨텍스트 윈도우가 효율성을 떨어뜨릴 정도로 느려지는지(체감상) 확인하는 것이 목적이었습니다.
사용 모델: Qwen3.6-35B-A3B-UD-Q5_K_S (MTP 버전) - 링크
OS/소프트웨어: Ubuntu 24.04 - Vulkan - MTP를 사용하기 위해 llama.cpp 서버의 MTP 프로토타입 도커 버전을 사용해야 했습니다 (이미지: havenoammo/llama:vulkan-server)
현재 300k 컨텍스트를 사용 중인데, VRAM 사용량이 32GB 중 28.3GB라 더 높일 수 있을 것 같습니다. (35B MoE 모델 기준) 400k도 가능할 것으로 보입니다.
GPU: Asus Radeon R9700 AI Pro 카드 (32GB RDNA 4 카드)
로컬 LLM 커뮤니티와 집에서 이런 강력한 모델을 돌릴 수 있게 해준 모든 분께 감사를 표하고 싶습니다. 불과 1년 전과 비교하면 정말 놀랍습니다. 이 기술을 탐구하는 것이 매우 즐겁고, 매일 새로운 것을 배울 때마다 경이로움을 느낍니다.
수정: 컨텍스트 세션이 깊어질 때(약 200k 지점) MoE 모델에서 문제가 발생하여 Qwen 3.6 27b 모델(비 MoE)로 전환했습니다. 결과는 업데이트하겠습니다.


