4x RTX 3090에서 돌려본 Qwen3.5-27B, 122B, 3.6-35B — MoE 모델은 엄격한 글로벌 규칙을 따르는 데 어려움을 겪음
Qwen3.5-27B, Qwen3.5-122B, and Qwen3.6-35B on 4x RTX 3090 — MoEs struggle with strict global rules
핵심 요약
4x RTX 3090 환경에서 Qwen 모델들의 에이전트 작업 성능과 규칙 준수 능력을 실측한 비교 분석.
- 성능 비교 — 27B dense 모델이 MoE 모델보다 엄격한 규칙 준수 면에서 더 안정적인 성능을 보임.
- 하드웨어 환경 — 4x RTX 3090 환경에서 vLLM을 사용하여 262k 컨텍스트를 유지하며 실측 데이터를 수집함.
- MoE의 한계 — 122B 및 35B MoE 모델들이 생성 속도는 빠르지만, 복잡한 에이전트 작업에서 규칙을 위반하는 경향이 있음.
- 최적화 전략 — 250W 전력 제한과 vLLM 설정을 통해 모델별 처리량과 프리필 성능을 정밀하게 측정함.
오랫동안 눈팅만 하다가 처음으로 글을 써봅니다. 4x RTX 3090 환경에서 세 가지 Qwen 모델을 각각 20회 이상의 라이브 에이전트 작업 세션에 투입해 보았습니다. 대상 모델은 Qwen3.5-27B dense, Qwen3.5-122B-A10B MoE, Qwen3.6-35B-A3B MoE입니다. 아래 수치는 합성 벤치마크가 아닌, 지속적인 실제 부하 상태에서 vLLM 로그를 파싱한 결과입니다.
이 글의 모든 수치에 영향을 미치는 워크로드 환경: 이 하네스는 30-60k 토큰 프롬프트로 1-6개의 OpenCode 세션을 동시에 실행하는 멀티 에이전트 오케스트레이터이며, 엄격한 bash 허용 목록을 강제합니다. 즉, 도구별로 uv run scripts/<name>.py 패턴만 허용하며, 셸 데코레이터(| head, | tail, timeout, 2>&1), 읽기 작업 시 절대 경로, cd && ... 체인 등을 사용할 수 없습니다. 이로 인해 규칙을 느슨하게 적용하는 환경보다 규칙 준수 능력이 훨씬 더 중요하게 작용합니다.
라우팅된 세 MoE 모델 모두 엄격한 글로벌 규칙을 준수하는 면에서 27B dense 모델보다 체계적으로 성능이 떨어집니다. 모델 크기, 활성 파라미터 수, 파인튜닝 타겟은 이 결과에 큰 영향을 주지 않았습니다. 먼저 속도 수치를 살펴보고, 이후 규칙 준수 격차를 다루겠습니다.
4x24GB 환경에서 262k 컨텍스트를 유지하면서 품질을 극대화하기 위해 선택한 모델 및 양자화 설정입니다:
- Qwen3.5-27B dense — INT8 (AWQ-BF16-INT8) 가중치, FP8 KV, MTP 추측 디코딩
- Qwen3.5-122B-A10B MoE — AWQ-INT4 가중치, FP8 KV. 262k 컨텍스트와 함께 사용하려면 Q4가 유일한 선택지입니다.
- Qwen3.6-35B-A3B MoE — FP8 가중치, FP16 KV (이 모델에서 FP8 KV는 불안정했습니다.)
작은 모델은 사용할 수 있는 모든 정밀도를 활용하고, 큰 모델은 메모리에 맞는 만큼만 사용했습니다. 아래 표는 250W(200/250/300W 테스트 결과 최적점) 기준입니다. vLLM v0.19.0 사용.
데이터 수집 방법: vLLM은 10초마다 Avg prompt throughput, Avg generation throughput, Running: N reqs를 출력합니다. 각 셀은 해당 동시성 상태에서의 윈도우 평균값입니다. (n=6 ≈ 해당 상태에서 60초의 벽시계 시간). 유휴 윈도우도 포함되며, 이는 피크 성능이 아닌 지속적인 처리량입니다.

