Qwen 3.8 27B xhigh vs medium small 비교 (재미로 다른 모델도 포함)
Qwen 3.8 27B xhigh vs medium small comparison (+ others for fun)
핵심 요약
Qwen 3.8 27B의 추론 강도(xhigh vs medium)에 따른 코드 생성 품질과 토큰 효율성을 비교한 실험입니다.
- 추론 강도 비교 — xhigh는 과도하게 생각하지만 결과물은 뛰어나고, medium은 효율적임
- 프롬프트 최적화 — 구체적인 지시사항을 추가하면 medium 설정으로도 높은 품질의 결과 도출 가능
- 사용 사례 제안 — 기획/설계는 xhigh, 단순 구현은 medium을 사용하는 방식이 효과적임
- 성능 트레이드오프 — 추론 예산이 곧 품질 조절 노브 역할을 하여 상황에 맞는 선택이 중요함
Qwen의 사고력을 확인해 보려고 진행한 작은 실험인데, xhigh 설정은 확실히 생각을 너무 많이 하네. 근데 결과물이 워낙 압도적이라 이게 나쁜 건지 잘 모르겠음. 프롬프트가 워낙 열린 결말이라 지 맘대로 해석한 감은 좀 있음. 세 줄 요약은 맨 아래에.
이미지 순서:
Qwen 3.8 27b xhigh, Qwen 3.8 27b medium, DS V4 Flash 기본 사고 모드, ChatGPT 무료 버전(사고 모드), Claude Opus 5 Medium, Qwen 3.8 27b medium 프롬프트 수정 버전
Qwen 27b는 UD_Q4_XL, DS4 Flash는 Q2_XXL 사용함
프롬프트: Write a simple html CARD about the benefits of eating apple. paste the code here.
27b의 xhigh 설정을 제외하면, 나머지 모델들은 전부 이걸 엄청 간단한 요청이라고 생각한 듯. 뭐 실제로도 간단하긴 한데, medium 설정조차 생각을 거의 안 하거나 몇 줄 끄적이고 말더라. 반면에 xhigh는 생각을 엄청 길게 하더니, 이번 테스트에서 다른 모델들은 비비지도 못할 결과물을 뽑아냄. 이게 좋은 건지 좀 애매한 게, A) xhigh 결과물 퀄리티가 미쳤음, B) 근데 프롬프트가 워낙 간단해서 사실 다른 모델들도 다 하긴 했거든.
토큰 수 (전체 출력 토큰 값):
3.8 27b xhigh: 23.8K
3.8 27b medium: 794
DS V4 Flash: 927
3.8 27b medium modified prompt: 3.3K
ChatGPT랑 Claude는 웹 버전 썼는데, 지금 토큰 수를 숨겨놔서 정확히는 모르겠지만 1K 넘지는 않을 듯.
27b medium 프롬프트 수정 버전:
Write a simple html CARD about the benefits of eating apple. paste the code here. It has a design of 'orchard notes' like a page from a notebook or a tear-off card. at the top it has the nr of the orchard note (apple is 01) and a header, then you get a perforation and the body afterwards. the body has an image (or emoji) of the apple in big and the benefits listed in interactable stylish format. then we have a small section for the stats e.g. calories, fiber etc for the apple and finally the card ends.


