Strata 엔진에서 구동한 Qwen3.8 Flash Next ISTA-DASLab GGUF: 12GB VRAM 및 64GB RAM 노트북에서 50t/s TG 및 1500t/s PP 달성
Qwen3.8 flash next ISTA-DASLab GGUF 50t/s TG and 1500t/s PP with 12GB VRAM and 64GB RAM Laptop on 'Strata' engine
핵심 요약
기존 llama.cpp보다 압도적인 속도를 보여주는 Strata 추론 엔진에 대한 사용자들의 긍정적인 평가와 기술적 검증 논의가 이어지고 있습니다.
- 추론 엔진 성능 — 기존 llama.cpp 대비 월등한 토큰 생성 및 처리 속도를 기록함
- 하드웨어 최적화 — 12GB VRAM 환경에서도 대규모 컨텍스트 처리가 가능함
- 기술적 검증 — 출력값의 정확성과 llama.cpp와의 동일성 여부에 대한 논의가 진행됨
- 커뮤니티 포크 — StrataGP 등 성능 향상을 위한 커뮤니티 차원의 최적화가 활발함
다들 이 추론 엔진 성능을 너무 과소평가하는 거 같은데, 솔직히 좀 아쉽다. llama.cpp 포크 버전들 이것저것 다 써봤는데 Strata만큼 속도 뽑아주는 게 하나도 없더라. 초기 버전엔 kv 캐시나 CPU 스로틀링 문제 좀 있었는데 개발자가 다 고쳐놨음.
추론 엔진 (현재는 Nvidia만 지원, AMD는 실험적 지원): https://github.com/Niko1221/Strata
측정 결과랑 스크린샷 몇 장 올려봄. 내 노트북 사양은 5070ti 12GB VRAM, 64GB ddr5 RAM, Intel 275HX CPU, gen4 SSD임.
Aquarium test (unsloth studio connected via local API)
사용한 모델은 https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main/IQ3_XXS인데, 사이즈 대비 퀄리티가 아주 괜찮음. 위 사진은 아쿠아리움 테스트 돌린 건데, 43k 컨텍스트 깊이에서 51 t/s 나오더라. 순정 llama.cpp는 같은 퀀트(quant)로 돌려도 23t/s밖에 안 나왔음.
32k context read at 1500t/s (unsloth studio via local API)
순정 llama.cpp로는 같은 퀀트 써도 PP(프롬프트 처리) 속도가 100t/s가 한계였거든. 근데 Strata는 32k 컨텍스트를 1500t/s로 읽어버림. 기대 이상으로 미친 성능임. 이 퀀트는 8bit로 200k 컨텍스트까지 올릴 수 있는데, 난 일단 131k 컨텍스트로 테스트해 봄.




