12GB Ampere 카드에서 200K 컨텍스트 + MTP를 지원하는 Qwen3.8 27B
Qwen3.8 27b with 200K ctx + MTP on 12GB Ampere Cards
핵심 요약
12GB VRAM 환경에서도 200K 이상의 긴 컨텍스트를 활용할 수 있도록 최적화된 Qwen3.8 27B 모델 릴리스입니다.
- 성능 최적화 — 3090 및 12GB 카드 사용자를 위한 런타임 개선 및 MTP 적용
- KVaRN 기술 — 새로운 스테이징/저널링 기법으로 성능 저하 없이 컨텍스트 확장
- 하드웨어 효율성 — 12GB VRAM에서 27B 모델을 구동하는 실용적인 양자화 방식 제공
- 오픈 소스 — MIT 라이선스로 공개된 LlamAmpere 프로젝트 및 모델 공유

다들 안녕!
지난번에 올렸던 LlamAmpere에 피드백이랑 의견 남겨준 사람들 다들 고마워. 3090 쓰는 형들을 위해 계속 개선 작업 중인데, 이번 릴리즈는 속도가 살짝(3~4%) 더 빨라졌고 런타임도 몇백 MB 정도 줄였어(YaRN 쓰면 이제 컨텍스트 최대 340K까지 지원함).
근데 이번 업데이트는 사실 지난 두 번의 릴리즈에서 소외됐던 12GB 카드 쓰는 형들이 메인이야. 런타임 최적화랑 조정(MTP 캐시 압축, 16비트 활성화, 불필요한 오버헤드 제거)을 싹 다 했고, KVaRN의 새로운 변종인 Staged + Journaled KVaRN도 추가했어. 덕분에 논문 기반 버전이랑 비교해서 KLD를 40% 정도 줄였다. 4/4가 이제 내가 추천하는 기본 설정인데(8/4 KV 캐시보다 성능 훨씬 좋음), 고사양 카드 쓰는 형들은 이거 쓰면 돼. 컨텍스트 최대한 뽑아먹고 싶은 형들은 3/3 비트(0.001 nats KLD)나 3/2(0.0024 nats)도 여전히 쓸만해(3/2의 KLD는 4 XL에서 4 S 퀀트로 넘어갈 때 생기는 성능 저하보다 작음). 테스트한 모델 기준으로 각각 205k에서 230k 컨텍스트까지 지원해(헤드리스 설정으로 GPU 100% 다 쓰면 훨씬 더 늘어남).
테스트한 모델은 swift-1.5-uncensored랑 mirai의 2.5 bpw 모델을 2.3bpw로 퓨전한 거야. 3060/80/ti 카드에서 7번 돌려봤는데 LiveCode Bench 기준으로 BF16 성능의 85%를 유지하더라. 3080/ti에서는 MTP 덕분에 평가 돌릴 때 평균 65~70 tps 정도 나왔어.
당연히 모델이 손실 없는 건 아니고, 다른 모델들처럼 사기 칠 생각도 없어. 근데 며칠 동안 hermes에서 직접 써보고 코딩 평가랑 pi 테스트까지 돌려보니까, 일반적인 에이전트 작업용으로는 진짜 쓸만해. 주관적으로는 qwen3.5랑 3.6의 BF16 버전 사이 어딘가쯤 되는 것 같은데, 12GB에 컨텍스트까지 챙긴 모델치고는 꽤 괜찮지 않냐?
LlamAmpere는 전처럼 MIT 라이선스야: https://github.com/JakeATX/llamAmpere
swift 1.5 기반 모델들(4 XS-M, 2.3bpw 등)은 여기 있어: https://huggingface.co/collections/jakeatx/qwen38-27b-models
(llamAmpere는 EXL도 지원하긴 하는데, 지금 프리필이랑 디코드 커널 개선 중이라 3~5 bpw 구간에서는 아직 최고 속도는 안 나와)
전처럼 결과나 버그 같은 거 있으면 공유해 줘. 백로그에 다 추가해 놓을게.
즐겁게 써!

