ByteShape Qwen3.6-35B-A3B: 6GB VRAM 노트북에서 Unsloth IQ보다 30% 빠른 성능
ByteShape Qwen3.6-35B-A3B: 30% faster than Unsloth IQ on 6GB VRAM laptop
핵심 요약
6GB VRAM 노트북 환경에서 ByteShape 양자화 모델이 Unsloth 대비 생성 속도에서 30% 향상을 보임.
- 성능 비교 — 6GB VRAM 환경에서 Unsloth 대비 30% 빠른 생성 속도 확인됨.
- 하드웨어 제약 — RTX 3060 6GB 환경에서 CPU 오프로드를 활용한 모델 구동 테스트 진행됨.
- 벤치마크 결과 — 생성 속도는 크게 개선되었으나 PP(프롬프트 처리) 속도는 소폭 하락함.
- 사용자 피드백 — 에이전트 작업 시 성능 저하 및 데이터 깨짐 현상이 보고됨.
며칠 전 6GB VRAM 노트북에서 MTP 실험을 한 적이 있는데, CPU 오프로드가 MTP 성능을 심각하게 저하시켜서 결과가 좋지 않았음. 하지만 이번에 Qwen3.6-35B-A3B용 새로운 ByteShape 퀀트를 시도해봤는데, 다른 모델보다 작고 빠르면서도 품질이 뛰어나다고 함. 이전까지 최고였던 Unsloth UD-IQ4_XS 설정과 ByteShape "CPU-5" 퀀트를 성능 면에서 직접 비교해보기로 함.
세 줄 요약: 6GB VRAM 노트북에서 CPU로 일부 오프로드했을 때, ByteShape 퀀트는 비슷한 크기의 Unsloth 퀀트보다 TG(생성) 속도는 30% 빠르지만 PP(프롬프트 처리) 속도는 약간 느림.
하드웨어
- Asus ROG Zephyrus G14 노트북, 2021년형
- AMD Ryzen 7 5800HS (8 CPU 코어 / 16 스레드)
- NVIDIA RTX 3060 Laptop GPU, 6GB VRAM
- 24GB RAM (DDR4 3200 MT/s), 1TB SSD
소프트웨어
- Linux Mint 22.2 (Ubuntu 24.04 기반), Radeon iGPU에서 Cinnamon 데스크탑 구동 (3060은 llama.cpp 전용으로 할당)
- llama.cpp 버전: 9203 (87589042c), GNU 13.3.0으로 빌드
- CUDA 12.0 설치
테스트 설정
모든 실험에서 다음 설정을 고정함:
- 컨텍스트 크기 65536 (Pi나 Dirac에서 에이전트 코딩을 하거나 Hermes Agent를 돌리기에 충분함)
- mmap 끄기, mlock 켜기, ubatch 크기 2048 (기본값 512보다 PP 속도가 훨씬 빠름)
- mmproj 없음 (이미지 입력 지원 불필요)
테스트한 퀀트 모델:
- Unsloth UD-IQ4_XS (17.7 GB)
- ByteShape CPU-5 aka Q4_K_S-4.22bpw (18.3 GB)
설정
models-preset.ini 내용:
version = 1
[Qwen3.6-35B-A3B]
# Unsloth variant
m = /proj/llms/Qwen3.6-35B-A3B-UD-IQ4_XS.gguf
# ByteShape variant
# m = /proj/llms/Qwen3.6-35B-A3B-Q4_K_S-4.22bpw.gguf
fit = true
fit-target = 64
c = 65536
chat-template-kwargs = {"preserve_thinking": true}
temp = 0.6
top-p = 0.95
min-p = 0.0
top-k = 20
repeat-penalty = 1.0
presence-penalty = 0.0
ctx-checkpoints = 64
flash-attn = on
b = 2048
ub = 2048
jinja = true
ctk = q8_0
ctv = q8_0
threads = 6
parallel = 1
cache-ram = 4096
mmap = false
mlock = true


