LexiPanel 최신 미공개 버전을 사용해 24GB 카드에 맞춘 262k 컨텍스트 Qwen3.8-27b 튜닝/abliterated GGUF 모델
Tuned/abliterated Qwen3.8-27b into a 24gb card 262k guff using the newest unreleased version of LexiPanel. It's fast with reliable draft acceptance. Made for 7900xtx but should work on whatever 24gb card with this setup and headless. Doesn't get dumber while coding like most of the other fine-tunes.
핵심 요약
24GB VRAM 환경에서 262k 컨텍스트를 지원하며 코딩 에이전트 작업에 최적화된 Qwen3.8-27B 모델 공유.
- 모델 최적화 — 24GB VRAM에 맞춰 262k 컨텍스트와 MTP draft 기능을 최적화함.
- 코딩 성능 — 코드 생성 시 지능 저하를 방지하고 에이전트 작업에 특화됨.
- AMD 지원 — RX 7900 XTX 환경에서 초당 36~41 토큰의 빠른 속도를 보여줌.
- LexiPanel 활용 — importance matrix와 tensor mix를 통해 하드웨어 효율을 극대화함.
https://huggingface.co/Wa1k3r/Qwen3.8-27b-CODER-4q_xs-24GB-262k-Optimalcardfit
Qwen3.8-27B CODER — IQ4_XS imatrix · 24GB 카드 최적화 · ~262k 컨텍스트 · MTP 드래프트
LexiPanel이 양자화, 검열 해제(Abliterated) 및 최적화함. Fit planner가 24GB GPU 하나에 꽉 차도록 240k 토큰 정도의 컨텍스트에 맞춰 텐서 조합을 짰음. 코드 위주의 텍스트로 중요도 행렬(importance matrix)을 만들었고, MTP 헤드는 Q8_0으로 유지해서 별도의 드래프트 모델 없이도 --spec-type draft-mtp가 바로 돌아감.
업로더는 매일 에이전트 코딩용으로 돌리는 중임. RX 7900 XTX에서 컨텍스트에 110k~170k 토큰이 이미 차 있는 상태로 36~41 tokens/s 속도가 나옴.
파일
| File | Type | Size | Inside |
|---|---|---|---|
Wa1k3r/Qwen3.8-27b-CODER-4q_xs-24GB-262k-Optimalcardfit.gguf | IQ4_XS + imatrix | 18.35 GB (17.1 GiB) | MTP head at Q8_0, token embeddings at Q4_K |
측정 속도 (합성 벤치마크가 아닌 실제 사용 환경)
2026년 10월 1일, 에이전트 코딩 세션에서 서버가 직접 측정한 98개 요청에 대한 결과임:
| Context already in the window | Requests | Decode, median | Decode, range |
|---|---|---|---|
| 65k – 131k tokens | 42 | 41.2 t/s | 33.8 – 46.0 t/s |
| 131k – 171k tokens | 56 | 36.0 t/s | 30.7 – 43.0 t/s |
-
MTP 드래프트 적중률: 중앙값 85% (요청의 절반이 75%에서 94% 사이). 드래프트 깊이 2단계에서 디코드 단계당 약 2.7 토큰 처리함.
-
프리필(Prefill):
-
108k 토큰짜리 콜드 프롬프트: 387 t/s;
-
147k~156k 깊이에서 약 4.5k 토큰 추가 시: 175~183 t/s.
-
-
VRAM: 245,760 토큰 컨텍스트에서 24.6GB 중 24.2GB 사용 중 (q4_1 KV 캐시, 비전 프로젝터는 CPU 사용).

