DGX Spark 하나에서 돌린 Ling-3.0-flash 양자화 사다리: 전체적으로 32~40 tok/s 범위 내에 머무름
Ling-3.0-flash quant ladder on one DGX Spark: the whole thing sits in a 32 to 40 tok/s band
핵심 요약
MoE 모델인 Ling-3.0-flash는 양자화 수준에 따른 속도 차이가 거의 없어 Q5가 성능과 속도 면에서 최적의 선택지임.
- 양자화 성능 — Q4, Q5, Q6 간 속도 차이가 32~40 tok/s로 매우 적음.
- MoE 구조 — 124B 모델 중 5.1B만 활성화되어 양자화가 디코드 속도에 미치는 영향이 미미함.
- 최적의 선택 — Q5가 속도와 품질 면에서 가장 효율적인 스위트 스팟으로 확인됨.
- 비교 데이터 — DeepSeek V4 Flash 대비 Q5는 약 2.4배, Q6는 약 2배 빠른 속도를 보임.
이번 결과에서 흥미로운 점은 최고 수치가 아니라, 사다리(양자화 단계)의 최상단과 최하단 사이의 간격이 얼마나 좁은가 하는 것입니다.
출처: 저는 inclusionAI에서 Ling 작업을 하고 있고, 이건 제 수치가 아닙니다. X의 sudoingX가 자신의 DGX Spark에서 전체 커뮤니티 GGUF 사다리를 벤치마킹했고, 허락을 받아 결과를 게시했습니다.
단일 스트림 디코드:
Q5_K_M, 40.2 tok/s, 가장 빠르고 손실 거의 없음
Q4_K_M, 38.2 tok/s, 가장 작은 풋프린트
Q6_K, 32.0 tok/s, 최고 품질, 최고 속도 대비 약 16% 감소
전체 사다리에서 32~40 tok/s. 124B 중 5.1B만 활성화되므로, 토큰당 파라미터가 거의 작동하지 않아 양자화가 디코드 속도에 거의 영향을 주지 않습니다. 비트 폭을 낮추면 보통 처리량이 확실히 늘어나는 밀집(dense) 모델과는 다른 양상입니다.
Q5가 가장 빠르면서도 손실이 거의 없는 선택지로 자리 잡았다는 점이 유용합니다. 보통은 둘 중 하나를 선택해야 하는 트레이드오프인데, 여기서는 스위트 스팟이 타협점이 아니라 그냥 정답이네요.
같은 장비에서의 비교를 위해 DeepSeek V4 Flash를 측정했는데 16.5 tok/s가 나왔습니다. 즉 Q5는 그보다 약 2.4배 빠르고, 최고 품질인 Q6도 거의 2배에 달합니다.
차트는 그 사람 것입니다. 혹시 Spark를 가지고 있고 다른 곡선이 나오는 분이 있다면 게시해주세요.

