Qwen 3.8 27b로 오늘 저녁 API 비용 650달러 이상 절약함
Qwen 3.8 27b saved me $650+ in API costs this evening
핵심 요약
Qwen 3.8-27B 모델을 로컬에서 구동해 대규모 토큰 작업을 처리하며 API 비용을 절감했다고 주장하는 글.
- 로컬 LLM 구동 — Qwen 3.8-27B 모델을 RTX PRO 6000 환경에서 8시간 이상 구동함.
- API 비용 절감 — 대규모 토큰 처리 작업을 로컬에서 수행하여 수백 달러의 API 비용을 아꼈다고 주장함.
- 기술적 성과 — 262K 컨텍스트 윈도우와 131M 입력 토큰을 처리하며 모델 생성 오류 없이 작업을 완료함.
- 비용 산정 논란 — API 모델별 비용 비교 방식과 실제 절감액에 대해 커뮤니티의 비판적인 의견이 많음.
DeepSeek Harness로 Qwen3.8-27B 테스트 좀 돌려봤는데, 이거 장기 작업 처리하는 능력이 진짜 괴물 수준이네. 결과 보고 좀 지렸다.
DeepSeek Harness는 내 윈도우 PC에서 돌렸고, LAN으로 연결된 다른 RTX PRO 6000 장비의 NInfer랑 통신하게 세팅했음. 모델은 262K 컨텍스트 윈도우를 먹인 Qwen3.8-27B를 썼고, 모든 셸 명령어랑 파일 작업은 클라이언트 PC에서만 처리했어. 서버는 오직 추론만 담당함.
양자화는 NInfer의 groupwise-int 아티팩트를 썼는데, 이게 Q4/Q5/Q6 혼합 할당 방식이야. 다음번엔 NInfer에서 지원하는 NVFP4 프로필도 한번 써볼 생각임.
8시간 넘게 돌린 결과
- 966번의 모델 호출
- 입력 토큰 130.2M개, 출력 토큰 812.5K개
- 압축 포함 시 입력 131.2M개, 출력 853.3K개
- 972번의 모델 대상 툴 호출
- 1,421번의 실제 로컬 툴 작업
- 31번의 자동 압축 시도
- 가중치 적용 디코드 속도 초당 104.83 토큰
- 모델 생성 실패 0건
컨텍스트 사이즈가 진짜 미친 듯이 커지더라. 루트 요청 중앙값은 136.6K 토큰, p95는 205.9K였고, 제일 큰 건 231.2K까지 찍음. 하네스가 출력 토큰 1개당 입력 토큰을 160개 정도 밀어 넣었으니, 반복되는 컨텍스트가 작업량의 대부분을 차지한 건 당연한 결과지.
재밌는 건 생성 속도 자체는 빨랐다는 거야. 논리적 입력을 첫 토큰 생성까지 걸린 총시간으로 나누면 루트는 초당 약 12.4K 프롬프트 토큰, 루트랑 서브 에이전트 합치면 초당 8.5K 토큰 정도 나오더라. 이게 순수 GPU PP/s는 아닌 게, 큐 대기 시간이나 프리픽스 재사용 같은 게 포함된 수치긴 하지만 클라이언트 입장에선 꽤 유의미한 지표지.
루트의 첫 토큰 생성 시간은 중앙값이 0.8초였는데 p95는 136초까지 튀었어. 서브 에이전트는 중앙값이 151초였는데, 정작 디코드 단계 중앙값은 5.3초밖에 안 걸림. NInfer가 GPU에 요청만 올리면 그냥 날아다니는 수준이야. 엔드포인트 하나에 에이전트 두 개를 동시에 돌리니까 큐 대기랑 프리필 경합이 좀 생기긴 하더라.
로컬 작업 1,421건 중에는 PowerShell 호출 576건, 읽기 259건, 수정 221건, 쓰기 161건, 검색 114건이 포함됨. 실패한 건 30건뿐이라 로컬 툴 레이어 에러율은 2.11%밖에 안 됨. 파일 툴 작업은 대부분 밀리초 단위로 끝났어.
이거 API로 돌렸으면 돈이 얼마 깨졌을까?
로컬에서 돌려서 토큰 비용은 0원이었지만, 현재 API 요금 기준으로 캐시 할인 없이 131.2M 입력이랑 853.3K 출력 작업량을 계산해 봤음.
| Model | Estimated API cost |
|---|---|
| DeepSeek V4 Flash | $18.61 |
| GPT-5.6 Luna | $27.26 |
| Claude Sonnet 5 | $270.93 |
| Claude Opus 4.6 | $677.32 |
가격 참조: DeepSeek, , , .


