Qwen3.6-27B-NVFP4 이미지 생성 테스트
Qwen3.6-27B-NVFP4 - images
핵심 요약
RTX 5090 노트북에서 Qwen3.6-27B-NVFP4 모델을 구동해 SVG 이미지 생성 성능과 속도를 테스트함.
- 하드웨어 성능 — RTX 5090 노트북 환경에서 37 t/s의 준수한 속도를 기록함.
- 모델 테스트 — Qwen3.6-27B 모델을 사용하여 다양한 SVG 이미지 생성을 시도함.
- 빌드 최적화 — Blackwell FP4 텐서 코어를 활용한 NVFP4 빌드 환경을 구축함.
- 결과 분석 — 이전 Q6_K 모델 대비 이미지 생성의 창의성이 다소 낮게 평가됨.
모델: Abiray-Qwen3.6-27B-NVFP4.gguf
사양:
-
Legion 7i Gen10 - NVIDIA GeForce RTX™ 5090
-
Intel® Core™ Ultra 9 275HX × 24
-
RAM 32.0 GiB
llamacpp 설정:
./build/bin/llama-server \
-m ~/.lmstudio/models/lmstudio-community/Qwen3.6-27B-GGUF/Abiray-Qwen3.6-27B-NVFP4.gguf \
-ngl 99 \
-c 131072 \
-t 16 \
-b 4096 \
-ub 2048 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
-fa 1 \
--defrag-thold 0.1 \
--temp 0.6 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0 \
--presence-penalty 0.0 \
--repeat-penalty 1.0 \
--metrics \
--host 0.0.0.0 --port 8080 \
-np 2
성공적인 빌드 세부 정보:
cmake -B build \
-DGGML_CUDA=ON \
-DCMAKE_CUDA_ARCHITECTURES="120" \
-DCMAKE_BUILD_TYPE=Release \
-DGGML_CUDA_F16=ON \
-DGGML_CUDA_NVFP4=ON \
-DGGML_CUDA_GRAPHS=ON \
-DGGML_CCACHE=OFF \
-DGGML_AVX512=ON \
-DGGML_AVX512_VNNI=ON \
-DLLAMA_CURL=ON \
-DCMAKE_C_COMPILER=/usr/bin/gcc-14 \
-DCMAKE_CXX_COMPILER=/usr/bin/g++-14 \
-DCMAKE_CUDA_HOST_COMPILER=/usr/bin/g++-14
cmake --build build --config Release -j$(nproc) 2>&1 | tee /tmp/build_llamacpp.log
NVFP4 ✅
mmq-instance-nvfp4.cu.o 컴파일됨 — Blackwell FP4 텐서 코어 활성화됨
mmq-instance-mxfp4.cu.o도 컴파일됨 — MX FP4 형식도 지원됨
모든 주요 백엔드 빌드 완료 ✅
libggml-cuda.so — GPU 백엔드
libggml-cpu.so — AVX-512/VNNI 플래그가 적용된 CPU 백엔드
libggml-base.so, libllama.so, libmtmd.so — 모든 공유 라이브러리
컴파일러 & CUDA ✅
GCC 14.3.0이 C++ 및 CUDA 호스트 모두에 올바르게 사용됨
CUDA 13.2.78 툴킷 감지 및 사용됨
아키텍처 자동 업그레이드 120 → 120a (Blackwell 가상 아키텍처 — 올바르며 더 나음, 하위 호환성을 위해 PTX 활성화)


