Strata와 Qwen3.8 Flash Next UD-Q4_K_XL 사용기
Strata with Qwen3.8 Flash Next UD-Q4_K_XL
핵심 요약
RTX PRO 6000 환경에서 Strata 백엔드를 활용한 Qwen3.8 모델의 압도적인 성능 벤치마크 공유.
- 성능 벤치마크 — vLLM 대비 2배 가까운 속도 향상 확인됨
- 하드웨어 요구사항 — UD-Q4_K_XL 모델 구동을 위한 대용량 RAM 필요성 논의
- 실제 사용 경험 — 코딩 및 복잡한 작업에서 뛰어난 효율성 입증
- 커뮤니티 반응 — 모델 성능과 하드웨어 구성에 대한 활발한 정보 공유
요즘 Strata 관련 글이 꽤 많이 보이길래 내 RTX PRO 6000으로 한번 돌려봤는데, 진짜 감탄했다.
벤치마크들 보면 대부분 IQ2나 IQ3 양자화 쓰던데, 나는 Unsloth의 UD-Q4_K_XL 성능이 어떤지 궁금해서 이걸로 테스트해 봄.
환경:
-
GPU: 1x RTX PRO 6000 Workstation (96GB)
-
모델: Qwen3.8-Flash-Next UD-Q4_K_XL (Unsloth)
-
백엔드: Strata
-
KV 캐시: INT8, 256K 컨텍스트
-
추론 가속(Speculative decoding): MTP-4
-
출력: 작업당 ~256 토큰
-
작업당 2회 실행
단일 요청 디코딩 (C1):
| Task | Strata (RTX PRO 6000) | vLLM (RTX PRO 6000) | vLLM (DGX Spark TP2) |
|---|---|---|---|
| Prose | 185.8 | 95.3 (-49%) | 38.2 (-79%) |
| Counting | 320.4 | 171.0 (-47%) | 75.3 (-77%) |
| Coding | 298.9 | 162.6 (-46%) | 60.1 (-80%) |
| Reasoning | 289.1 | 149.6 (-48%) | 51.8 (-82%) |
VLLM 인스턴스들은 둘 다 엔비디아의 NVFP4 양자화를 쓴 거라 완벽한 1:1 비교는 아니지만, 속도 차이는 확실히 체감되네.
Qwen 3.8 flash next는 코딩 작업할 때 진짜 날아다닌다. 효율성 미쳤음. Qwen 4 나오면 바로 달려야지.


