RTX 3060에서 ~3 BPW로 돌리는 Qwen 3.8 27B: GSQ vs ByteShape IQ3-XXS 2.88BPW
Qwen 3.8 27B at ~3 BPW on an RTX 3060: GSQ vs ByteShape IQ3-XXS 2.88BPW
핵심 요약
RTX 3060 환경에서 Qwen 3.8 27B 모델의 GSQ와 ByteShape 양자화 성능을 비교한 결과, GSQ가 훨씬 우수한 성능을 보임.
- 성능 비교 — GSQ 양자화 모델이 ByteShape보다 훨씬 안정적이고 빠른 결과물을 생성함.
- 하드웨어 제약 — RTX 3060 12GB 환경에서 KV 캐시와 모델 크기 최적화가 필수적임.
- 양자화 방식 — IQ3-XXS 등 초저비트 양자화 모델들의 성능 차이가 실제 사용 환경에서 크게 나타남.
- 모델 추천 — 사용자들이 각자의 환경에서 검증된 다양한 Qwen 3.8 27B 양자화 버전을 공유함.

전에 내가 GSQ 양자화 테스트한 거 보고 누가 ByteShape Qwen 3.8 27B IQ3-XXS GGUF 한번 써보라고 추천하더라.
그래서 써봤지.
근데 결과가... 놀라울 정도로 개판이네.
참고로 내 환경은 이거임:
-
RTX 3060 12GB
-
16GB DDR4 RAM, 싱글 채널
-
CachyOS / Arch Linux
-
llama.cpp
-
Qwen 3.8 27B
-
가능한 경우 MTP/speculative decoding 적용
비교해본 저비트 양자화 모델 두 개는 이거임:
ISTA-DASLab / GSQ-RCO-IQ3-XXS
-
~10.4GB
-
대략 2.5 BPW 수준
-
MTP 활성화
-
풀 컨텍스트에서 ~29 tok/s
-
컨텍스트 낮을 때 ~34–40 tok/s
-
이건 내가 저번에 웹 개발 테스트할 때 쓰던 거임.
ByteShape IQ3-XXS
-
용량은 대략 500MB 더 작음
-
마찬가지로 초저비트 영역대
-
KL-divergence 측정 기준으로 BF16 모델이랑 유사도가 엄청나게 높다고 광고함
스펙상으로는 ByteShape 양자화 모델이 진짜 흥미로워 보였거든.
용량은 더 작은데 원본 BF16 모델이랑 유사도는 엄청나게 유지한다잖아. 심지어 훨씬 높은 BPW 양자화 모델들이랑 비교해도 꿀릴 게 없다고 했고.
그래서 당연히 GSQ 버전이랑 비비거나 더 나을 줄 알았지.
근데 아니더라.
실제 결과는 위에 적어둔 대로임
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF는 55k 토큰도 안 써서 3D 복셀 디오라마를 한 방에 뽑아냈는데, Byteshape 3.8 27B 모델은 세 번이나 시도했는데도 98k 토큰 넘게 처먹고 아직도 완성을 못 함.

