Qwen 3.6 35B MoE와 Qwen 3.5 35B MoE의 연구 논문 웹앱 생성 비교
Comparison Qwen 3.6 35B MoE vs Qwen 3.5 35B MoE on Research Paper to WebApp
핵심 요약
Qwen 3.6 35B MoE와 3.5 모델의 성능을 연구 논문 기반 웹앱 생성 작업으로 비교한 테스트 결과.
- 모델 성능 비교 — Qwen 3.6과 3.5 35B MoE 모델의 웹앱 생성 결과물을 직접 비교함.
- 양자화 테스트 — GGUF 포맷의 다양한 양자화 수준(IQ4_XS, Q4_K_XL 등)에 따른 성능 차이를 논의함.
- 하드웨어 제약 — 16GB VRAM 환경에서 MoE 모델을 효율적으로 구동하기 위한 최적의 양자화 전략을 공유함.
- 커뮤니티 피드백 — 새로운 모델의 성능 변화와 향후 개선 가능성에 대해 사용자들 간 의견을 교환함.
참고: 왼쪽이 Qwen3.5 35B MoE, 오른쪽이 Qwen3.6
안녕하세요 여러분,
Qwen3.6 35B MoE와 Qwen 3.5 35B MoE를 간단히 비교해 봤습니다. llama.cpp를 사용했고 추론(reasoning)은 껐으며, 동일한 unsloth 4 K_XL GGUF 양자화 버전을 사용했습니다.
첫 번째가 Qwen3.5 결과물이고 두 번째가 Qwen3.6입니다.
판단은 여러분께 맡길게요. 결론을 내리기 전에 실험을 더 해봐야 할 것 같습니다.
이전에 qwen3.5 35B로 만들었던 것과 동일한 스킬을 사용했습니다.
statisticalplumber/research-webapp-skill
@echo off
title Llama Server
:: Set the model path
set MODEL_PATH=C:\Users\Xyane\.lmstudio\models\unsloth\Qwen3.6-35B-A3B-GGUF\Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf
echo Starting Llama Server...
echo Model: %MODEL_PATH%
llama-server.exe -m "%MODEL_PATH%" --chat-template-kwargs "{\"enable_thinking\": false}" --jinja -fit on -c 90000 -b 4096 -ub 1024 --reasoning off --presence-penalty 1.5 --repeat-penalty 1.0 --temp 0.6 --top-p 0.95 --min-p 0.0 --top-k 20 --keep 1024 -np 1
if %ERRORLEVEL% NEQ 0 (
echo.
echo [ERROR] Llama server exited with error code %ERRORLEVEL%
pause
)



