단일 RTX 3090에서 DeepSeek-V4-Flash IQ2_XS 구동 테스트 (Döner Bench)
Döner Bench DeepSeek-V4-Flash IQ2_XS running on a single RTX 3090
핵심 요약
RTX 3090 24GB 한 장으로 DeepSeek-V4-Flash IQ2_XS 양자화 모델을 구동하여 도너 케밥 시뮬레이션 구현에 성공함.
- DeepSeek-V4-Flash — IQ2_XS 초저정밀도 양자화 모델을 RTX 3090에서 테스트함.
- Döner Bench — HTML 캔버스로 회전하는 도너 케밥을 구현하는 독특한 프롬프트를 사용함.
- 구동 성능 — 초당 약 9~10 토큰(tps)의 속도를 기록하며 작동하는 결과물을 생성함.
- 커뮤니티 반응 — 낮은 양자화 비트수에도 결과가 나온다는 점과 기상천외한 벤치마크 방식에 주목함.
최근의 모델 양자화 비교와 비슷한 테스트를 해봤는데, 이번에는 여기에만 집중해봤어:
DeepSeek-V4-Flash-0731-IQ2_XS-Experts-Q8_0
모델 링크 bullerwins/DeepSeek-V4-Flash-0731-GGUF · Hugging Face
하드웨어
- RTX 3090 24 GB
- 128 GB DDR4 RAM
- Windows
- llama.cpp / llama-server
프롬프트
라이브러리 없이 전체 화면 캔버스가 포함된 단일 HTML 파일을 작성해줘. 가스 가열 장치 앞에서 수직으로 회전하는 사실적인 도너(Döner) 스타일 케밥 꼬치를 시뮬레이션해봐.
결과 렌더링은 첨부된 이미지에 나와 있어.
모델 대부분이 IQ2_XS로 양자화되었다는 점을 고려하면, 완전하고 작동하는 결과물을 만들어냈다는 게 인상적이었어. 분명 완벽하지는 않고 세부 묘사나 사실성은 좀 떨어지지만, 전체적인 장면과 애니메이션, 요청한 컨셉은 여전히 잘 구현되어 있어.
사용된 명령어
"D:\cpp\llama-server.exe" ^
-m "E:\models\DeepSeek-V4-Flash-0731-IQ2_XS-Experts-Q8_0\DeepSeek-V4-Flash-0731-IQ2_XS-Experts-Q8_0.gguf" ^
--fit on ^
--fit-ctx 32768 ^
--fit-target 1024 ^
--jinja --metrics --perf ^
-np 1 ^
-ub 4096 -b 4096 ^
--no-kv-unified ^
--no-mmap ^
--flash-attn on ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--temp 1.0 --top_k 40 --top_p 1.0 ^
--min-p 0.00 --repeat-penalty 1.0 --presence-penalty 0.0 ^
--threads 14


