Qwen 3.8 27B의 과도한 사고, Opus 4.6을 이기기 위한 필수적인 과정
Qwen 3.8 27B Overthinking, It has to be done, it has to be overthinking to punch Opus 4.6
핵심 요약
Qwen 3.8 27B 모델의 과도한 토큰 사용은 고성능 모델과 경쟁하기 위한 전략적 선택이며, 설정 조절로 최적화가 가능함.
- 사고 토큰의 필요성 — 27B 모델이 대규모 모델과 경쟁하려면 더 많은 추론 토큰이 필수적임.
- 사용자 경험 변화 — 과거보다 버그 수정 시간이 단축되었으며, 로컬 모델은 기다림의 미학을 제공함.
- 성능 최적화 — 추론 설정을 'medium'으로 낮추거나 템플릿을 수정해 토큰 낭비를 줄일 수 있음.
- 로컬 모델의 강점 — 오픈 소스 라이선스와 로컬 실행 가능성으로 OpenAI의 대안이 됨.
그래, 16K가 넘는 추론 토큰 기다리느라 시간 낭비하는 거 빡치는 거 맞음. 근데 생각해 봐, 이건 고작 27B 모델인데 1T가 넘는 파라미터 모델들이랑 비비려고 애쓰는 중임. 뭔가 하나는 포기해야 하는데, 그게 바로 추론이나 궤적 토큰의 양인 거지.
이게 LLM 판에서 딱히 새로운 얘기도 아님. 안드레이 카파시(Andrej Karpathy) 본인도 LLM은 생각할 토큰이 필요하다고 누누이 말해왔음. 자기 "Let's build GPT" 시리즈나 GPT 관련 영상 어딘가에서 언급했는데, 정확히 언제인지는 기억 안 나지만 아마 Llama 베이스 모델 보여줄 때였을 거임.
SWE-Rebench에서도 이 점을 지적했지:
https://swe-rebench.com/?insight=feb_2026
"Qwen Next랑 Step 3.5도 엄청난 양의 토큰을 잡아먹는 극단적인 사례임." 참고로 Qwen Next는 GDA를 탑재한 첫 Qwen 모델이기도 함. SWE-Rebench에 따르면 "문제당 평균 8.12M 토큰"을 쓴다더라.
딴소리 좀 하자면 VibeThinker 3B라는 모델이 있음. 이건 에이전트 작업이나 툴 콜링용이 아니라 순수하게 논리랑 수학 문제 풀려고 만든 모델임. 직접 써봤는데, 그냥 대학원 수준 수학 모델을 3B 파라미터에 쑤셔 박아놓은 느낌임. 근데 이것도 토큰 처먹는 걸 존나 좋아함. 다시 말하지만, 이건 30억 파라미터짜리 모델임. 맙소사, 내 폰에서도 돌아간다고.
기대치에 대해 말하자면, LLM 광풍 불기 전에는 버그 하나 찾아서 고치는 데 3시간은 기본이고, 길게는 며칠, 몇 주씩 걸리기도 했음. 지금은 n-shot 프롬프트만 잘 짜면 한 시간 안에도 뚝딱임. 다들 GPT나 Claude 같은 거 쓰다가 이런 로컬 모델로 넘어왔을 테니, 빠른 토큰 생성 속도에 너무 길들여진 거 아님?
너네는 어떨지 모르겠는데, 난 사실 일상적인 검색 작업에 많이 씀. 아마 Gemma 4 26B A4B를 쓰거나, 아니면 그냥 구관이 명관이라고 GPT-OSS 20B를 쓸 듯(이 글 문법도 GPT OSS가 고쳐준 거임). 게이트웨이에서 토큰 사용량 확인해 보면, 실제 코드 생성보다는 RAG나 코드 검색에 쓰는 게 훨씬 많거든.
토큰 낭비가 시간 낭비인 건 맞는데, Qwen 27B가 에러 찾는 동안 딴짓하면 그만임. LLM이 너한테 돌려준 '공짜 시간'인 셈이지. 4060 Ti 같은 걸로 돌리면 한 시간 걸릴 수도 있겠지만, 로봇 청소기랑 똑같음. 시간은 걸려도 '네 시간'은 아니잖아.
내가 DSv4 Flash를 6 tok/s로 돌리면서도 아무 불만 없는 이유가 바로 이거임.
결국 Qwen은 기술적으로나 철학적으로나 OpenAI의 정반대 지점에 있는 모델임. 아파치 라이선스고, 내일이 없는 것처럼 토큰을 처먹고(적어도 API 단에서 추론 토큰을 거의 안 보여주는 SOTA 모델들과는 정반대지), 완전히 네 거고, llmfan46 같은 튜닝도 가능하고, 무엇보다 16GB VRAM 카드랑 시스템 RAM만 있으면 현실적으로 돌릴 수 있거든.
아, 그리고 정 꼬우면 llamacpp나 vllm에서 추론 토큰 제한을 8192로 걸어버리면 됨.

