V100 32GB에서 Qwen 3.6 27B MTP 구동: 54 t/s 달성
Qwen 3.6 27B MTP on v100 32GB: 54 t/s
핵심 요약
V100 32GB 환경에서 llama.cpp의 MTP 브랜치를 활용해 Qwen 3.6 27B 모델로 초당 54토큰의 속도를 구현함.
- 성능 최적화 — MTP 브랜치 적용으로 기존 대비 2배 가까운 속도 향상 달성함.
- 하드웨어 활용 — V100 32GB 환경에서 200k 컨텍스트 제한으로 안정적인 구동 확인됨.
- 코딩 능력 — 툴 호출 및 코드 리팩토링 작업에서 매우 우수한 성능을 보여줌.
- 모델 비교 — 35B MOE 모델보다 코딩 작업에서 더 뛰어난 효율성을 보임.
V100 32GB SXM 모듈(PCIe 어댑터 사용)에서 am17an의 llama.cpp MTP 브랜치를 사용해 좋은 결과를 얻었다는 짧은 기록이야. 빌드도 한 번에 성공했고 llama-server도 문제없이 돌아갔어.
am17an의 MTP GGUF, q8_0 kv 캐시, 그리고 VS Code 코파일럿으로 활용하기 위한 200k 캐시 제한을 설정해서 테스트했어.
29-30 t/s (MTP 미사용 시)
54-55 t/s (MTP 사용 시, 카드 전력 제한 150W 적용)
50k 토큰을 처리하고 나면 40-45 t/s로 떨어지긴 하지만, 툴 호출이나 서브 에이전트 작업은 아주 잘 수행하고 있고 코드 리뷰나 리팩토링에서도 통찰력 있는 결과를 보여줬어.
am17an에게 감사해! 이 브랜치가 더 발전해서 정식으로 나오길 기대하고 있어, 정말 대단한 작업이야.


