Qwen 3.8 Next Flash 진짜 너무너무너무 장황함..
Qwen 3.8 Next Flash is really really REALLY verbose..
핵심 요약
Qwen 3.8 Next Flash 모델의 지나치게 긴 사고 시간과 장황한 출력에 대한 불만 토로.
- 모델 장황함 — 코딩 작업 시 사고 시간이 너무 길고 결과물에 불필요한 전문 용어가 섞임.
- 사고 시간 문제 — 단일 작업에 13분 이상 소요되며 하드웨어 자원을 과도하게 점유함.
- 성능 논쟁 — 사고 시간을 줄이면 모델 성능이 저하될까 봐 설정을 낮추기 꺼려함.
- 사용자 반응 — 사고 시간이 길어도 결과물이 좋다는 의견과 효율성이 떨어진다는 의견이 대립함.
3.6 27b를 오랫동안 쓰다가 3.8 27b보다도 확실히 업그레이드된 느낌이라 Next Flash로 갈아탔거든. 근데 이거 진짜 말 너무 많아. 코딩 요청 하나 던지면 생각하는 시간만 13분씩 걸림. tg는 초당 150 토큰, pp는 초당 7000 토큰 정도 나오는데 말이야. 솔직히 쓰다 보면 속 터져. 한참 뒤에 확인해 봐도 여전히 생각 중이고, 결과물도 평타는 치는데 조금이라도 판단이 필요한 작업 시키면 갑자기 뭔 개소리인지 모를 전문 용어랑 유행어만 잔뜩 섞인 알파벳 수프를 만들어 놓음. 실제 개발 현장에선 아무도 안 쓰는 말들만 골라서 말이지.
VSCode에 API 키 넣어서(BYOK) 돌리면 그나마 런타임이 짧아지긴 하는데, pi.dev에서 쓰면 한 시간씩 걸릴 때도 있다고!
생각 수준(thinking level) 낮추라고 하기 전에 미리 말하는데, 모델 성능 떨어질까 봐 그러긴 싫어. 생각 수준에 따른 모델 성능 변화를 보여주는 확실한 벤치마크도 아직 없잖아. 근데 3.8 27b 때 보면 생각 수준이 결과물 퀄리티에 꽤 영향을 주는 것 같더라고.


