Qwen 3.8 27b와 DSH(DeepSeek Harness) 조합은 최고다!! 지금까지의 경험과 성능.
Qwen 3.8 27b with DSH(DeepSeek Harness) is Amazing!! Experiences so far and perfomance.
핵심 요약
Qwen 3.8 27b 모델과 DeepSeek Harness를 조합해 사용한 결과, 뛰어난 성능과 안정적인 컨텍스트 처리를 경험했다는 후기.
- 성능 및 안정성 — 90k 컨텍스트에서도 자동 압축을 통해 오류 없이 뛰어난 결과물을 보여줌.
- 하드웨어 제약 — RTX 3090 환경에서 평균 37 tok/s의 속도를 보이며, dense 모델 특성상 고사양 VRAM이 필수적임.
- 추론 최적화 — 기본 설정인 xHigh 추론 모드로 인해 응답 대기 시간이 길지만, 결과물은 매우 만족스러움.
- 향후 기대 — 24시간 구동을 위해 더 효율적인 35b MoE 모델 출시를 기다리고 있음.
새로 나온 qwen 3.8로 이것저것 하네스랑 코딩 에이전트 테스트해 보는 중인데, 여러 개 써본 결과 deepseek 하네스 조합이 제일 지리더라. qwen이랑 같이 쓰니까 결과물 진짜 미쳤음. 손에 제대로 된 물건 하나 쥔 기분이다.
멈추지도 않고, 뻗지도 않고, 에러도 안 남. 10시간째 돌리는 중인데 컨텍스트 90k까지 차도 알아서 압축하고 지가 뭘 하던 건지 절대 안 까먹음.
지금까지 1천만 토큰 넘게 먹였는데 목표에서 벗어나지도 않고 문제마다 원샷으로 다 해결함.
유일한 단점은 당연히 속도지. 컨텍스트 늘어나고 그래픽카드 230w(rtx 3090) 풀로 땡기면 평균 37tok/s 정도 나옴. 깔끔한 새 프롬프트에선 50 정도 나오고, unsloth studio 새 채팅창에선 56~60 tk/s 정도 찍히더라.
쓰고 있는 퀀트는 UD q4 k xl + vision F16이고 컨텍스트는 92k로 잡았음. MTP + ngram 켰고 GPU 레이어는 66개, CPU 오프로딩은 안 함.
여기 서브레딧에서 주워들은 정보로 보면, llama.cpp 기본 설정이 xHigh thinking이라 결과가 이렇게 잘 나오는 듯. 근데 생각하는 시간이 진짜 길긴 함. 가끔은 뭐 쓰기도 전에 20분 동안 생각만 하더라. 생각하는 설정 어떻게 바꾸는지 모르겠는데, 뭐 xHigh로도 만족하고 좀 더 기다리는 건 괜찮음.
지금 내가 진짜 필요한 건, qwen 신께 비는데, 35b moe 모델 좀 내줬으면 좋겠다. 이 덴스 모델을 내 컴패니언 에이전트로 24시간 내내 돌리는 건 좀 무리임(내 GPU가 꽤 좋긴 하지만). 덴스 모델이라 CPU 오프로딩도 안 되고, VRAM 16GB 이상은 있어야 제대로 돌아감. 블랙웰 GPU 있으면 더 좋겠지. 5090에 vllm 쓰는 애들은 150~200 tk/s 뽑는다더라.

