Qwen 3.8 27b는 Q3_xxs에서도 강력함
Qwen 3.8 27b is strong even at Q3_xxs
핵심 요약
Qwen 3.8 27b 모델이 낮은 양자화 수준에서도 뛰어난 코딩 성능과 속도를 보여주어 사용자들에게 호평받고 있음.
- 코딩 성능 — 낮은 양자화에서도 복잡한 코딩 작업을 한 번에 성공적으로 수행함.
- 추론 속도 — VRAM에 완전히 로드 시 30-35t/s의 빠른 속도를 보여줌.
- 하드웨어 효율성 — 16GB VRAM 환경에서 고성능 모델을 효율적으로 구동 가능함.
- 모델 비교 — 이전 버전인 Qwen 3.6 35b나 다른 MoE 모델보다 우수한 성능을 입증함.
보통 Q3 양자화는 결과물이 너무 씹창나는 경우가 많아서 거르는 편임. 내 그래픽카드가 RTX 4060 Ti 16GB라 평소엔 Q4가 마지노선이거든. 근데 아직 35b-3ab 모델이 안 나와서 어쩔 수 없이 한번 써봤음. 난 코딩할 줄 몰라서 LLM을 에이전트 워크플로우 같은 데는 안 쓰고 그냥 Textgen으로만 돌리거든. 그래서 코딩이 주 용도는 아닌데, 가끔 진짜 코딩 관련해서 도움받아야 할 때가 있단 말이지.
근데 이거 진짜 물건임. 웬만한 빡센 코딩 작업들을 원샷으로 다 끝내버리는데, 게임이나 웹 앱이 바로 돌아가는 수준으로 뽑아줌. 예전에 쓰던 Qwen 3.6 35b는 이런 거 시키면 아예 맛이 가거나, 몇 시간, 며칠씩 붙잡고 피드백 줘가면서 쌩쇼를 해야 겨우 돌아갔거든.
VRAM에 다 올리면 속도도 존나 빠름. 30~35t/s 나오는데, RAM까지 끌어다 쓴 고양자화 35b 모델이랑 속도가 거의 똑같음. 컨텍스트 길어질 때만 21~22t/s 정도로 떨어지고. Gemma 3 27b나 Mistral small 24b 같은 구형 덴스 모델들은 잘 나와야 13~17t/s 찍는 게 고작인데 말이야.
딱 하나 눈에 띄는 단점은, 어려운 수학이나 논리 문제는 원샷으로 풀어버리면서 정작 일반적인 대화에서는 가끔 헛소리를 하거나, 간단한 정렬이나 점수 세는 걸 틀릴 때가 있음. 이게 모델 자체가 코딩에 몰빵해서 그런 건지, 아니면 저양자화 때문인지 잘 모르겠네. (개인적으론 후자 영향이 클 거 같긴 한데, 이거 고양자화로 돌려본 형들 경험담 좀 듣고 싶음.)
어쨌든 지금까지는 대만족임. 내가 써본 고양자화 Q4~Q5 MoE 모델들보다 훨씬 나음.

