Qwen 3.6 35B UD 2 K_XL은 체급 이상의 성능을 보여줌 (이제 GPU 부족은 옛말)
Qwen 3.6 35 UD 2 K_XL is pulling beyond its weight and quantization (No one is GPU Poor now)
핵심 요약
Qwen 3.6 35B 모델이 16GB VRAM 환경에서도 뛰어난 툴 콜링과 대규모 컨텍스트 처리 능력을 입증함.
- 모델 성능 — 35B 모델이 98.3%의 툴 콜링 성공률과 270만 토큰 처리 능력을 보여줌.
- 하드웨어 최적화 — 16GB VRAM 노트북 환경에서 llama.cpp를 활용해 대규모 컨텍스트를 효율적으로 구동함.
- 툴 콜링 효율 — 복잡한 웹 앱 빌드 작업에서 58번의 툴 콜을 성공적으로 수행함.
- 양자화 활용 — K_XL 양자화 모델을 통해 낮은 VRAM에서도 고성능 모델을 구동할 수 있음을 증명함.
여러분 안녕하세요,
다시 돌아왔습니다. 동일한 '논문에서 웹 앱 만들기' 작업으로 Qwen 3.6 UD 2 K_XL Unsloth 모델을 테스트해 봤습니다. 모델 성능이 매우 훌륭하네요. 모든 툴 콜을 적절히 처리했고, 16GB VRAM 노트북에서 llama.cpp를 사용해 대규모 컨텍스트도 잘 관리했습니다.
모든 세부 사항을 첨부했습니다.
총 툴 콜 58회,
성공률 98.3%.
또한 모델은 주어진 논문으로 앱을 빌드하는 동안 약 270만 토큰을 처리했습니다.
이전에 Qwen 35B 모델로 만들었던 기술을 사용해 이 모델을 테스트해 볼 수 있습니다.
statisticalplumber/research-webapp-skill
@echo off
title Llama Server - Gemma 4
:: Set the model path
set MODEL_PATH=C:\Users\test\.lmstudio\models\unsloth\Qwen3.6-35B-A3B-GGUF\Qwen3.6-35B-A3B-UD-Q2_K_XL.gguf
echo Starting Llama Server...
echo Model: %MODEL_PATH%
llama-server.exe -m "%MODEL_PATH%" --chat-template-kwargs "{\"enable_thinking\": false}" --jinja -fit on -c 90000 -b 4096 -ub 1024 --reasoning off --presence-penalty 1.5 --repeat-penalty 1.0 --temp 0.6 --top-p 0.95 --min-p 0.0 --top-k 20 --context-shift --keep 1024 -np 1
if %ERRORLEVEL% NEQ 0 (
echo.
echo [ERROR] Llama server exited with error code %ERRORLEVEL%
pause
)


