M3 Ultra에서 5개 에이전트 프레임워크를 활용한 Qwen 3.6 및 6개 모델 벤치마크
Qwen 3.6 vs 6 other models across 5 agent frameworks on M3 Ultra
핵심 요약
Apple Silicon 환경에서 다양한 에이전트 프레임워크와 모델의 도구 호출 성능 및 속도를 비교 분석한 결과입니다.
- Qwen 모델 성능 — Qwen 시리즈가 모든 프레임워크에서 100%에 가까운 도구 호출 성공률을 기록함
- smolagents의 유연성 — 텍스트 기반 코드 생성 방식을 사용하여 도구 호출에 취약한 모델도 에이전트로 활용 가능함
- 양자화 영향 — 4비트보다 8비트 양자화 모델이 코드 생성 및 지식 평가에서 더 높은 품질을 보여줌
- 벤치마크 도구 — Rapid-MLX 서버를 통해 Apple Silicon 환경에서 모델별 속도와 호환성을 정밀하게 측정함
Apple Silicon에서 5개의 에이전트 프레임워크에 걸쳐 Qwen 3.6, Qwen 3.5 및 5개의 다른 모델을 벤치마크했습니다. 전체 호환성 매트릭스는 다음과 같습니다.
하드웨어: Apple M3 Ultra, 256GB 통합 메모리
테스트한 프레임워크: Hermes Agent (64K stars), PydanticAI, LangChain, smolagents (HuggingFace), OpenClaude/Anthropic SDK
테스트한 모델: Qwen 3.6 35B (신규), Qwen 3.5 35B, Qwopus 27B, Qwen 3.5 27B, Llama 3.3 70B, DeepSeek-R1 32B, Gemma 4 26B
에이전트 호환성 매트릭스
이것은 제가 시작하기 전에 존재했으면 했던 부분입니다. 각 셀은 구조화된 도구 호출 테스트(단일 도구, 다중 도구 선택, 다중 턴, 스트리밍, 스트레스 테스트, 다중 도구 주입, 누출 방지 확인)에 대한 통과율입니다.
|모델|Hermes|PydanticAI|LangChain|smolagents|OpenClaude|속도|
|:-|:-|:-|:-|:-|:-|:-|
|Qwen 3.6 35B (4bit)|100%|100%|93%|100%|100%|100 tok/s|
|Qwen 3.5 35B (8bit)|100%|100%|100%|100%|100%|83 tok/s|
|Qwopus 27B (4bit)|100%|100%|100%|100%|100%|38 tok/s|
|Qwen 3.5 27B (4bit)|100%|100%|100%|—|—|38 tok/s|
|Gemma 4 26B (4bit)|100%|67%|—|100%|80%|~40 tok/s|
|DeepSeek-R1 32B (4bit)|55%|50%|—|100%|40%|~30 tok/s|
|Llama 3.3 70B (4bit)|45%|67%|67%|100%|—|~20 tok/s|
핵심 요약: Qwen 제품군은 도구 호출을 완전히 장악하고 있습니다. 모든 Qwen 모델이 모든 프레임워크에서 100%(또는 거의 100%)를 달성합니다. Qwen이 아닌 모델들은 어떤 프레임워크를 사용하느냐에 따라 결과가 갈립니다.
속도 벤치마크 (decode tok/s, 동일 하드웨어)
|모델|RAM|속도|도구 호출|최적 용도|
|:-|:-|:-|:-|:-|
|Qwen3.5-4B (4bit)|2.4 GB|168 tok/s|100%|16GB MacBook, 빠른 반복|
|GPT-OSS 20B (mxfp4)|12 GB|127 tok/s|80%|속도 + 준수한 품질|
|Qwen3.5-9B (4bit)|5.1 GB|108 tok/s|100%|대부분의 Mac에 적합|
|Qwen 3.6 35B (4bit)|~20 GB|100 tok/s|100%|신규 — 256 전문가, 262K 컨텍스트|
|Qwen3.5-35B (8bit)|37 GB|83 tok/s|100%|토큰당 최상의 품질|
|Qwen3.5-122B (mxfp4)|65 GB|57 tok/s|100%|프런티어급, 96GB+ Mac|
참고로 Ollama는 같은 기기에서 Qwen3.5-9B로 ~41 tok/s를 기록합니다. 따라서 이 수치들은 2-3배 더 빠릅니다.
모델 품질 기준 (HumanEval + tinyMMLU)
속도가 전부는 아닙니다. 코드 생성 및 지식에 대한 모델들의 성능은 다음과 같습니다.
|모델|HumanEval (10)|MMLU (10)|도구 호출|MHI 점수|
|:-|:-|:-|:-|:-|
|Qwopus 27B|80%|90%|100%|92|
|Qwen 3.5 27B|40%|100%|100%|82|
|Qwen 3.5 35B (8bit)|60%|40%|100%|76|
|Qwen 3.6 35B (4bit)|20%|30%|100%|56|
|Llama 3.3 70B|50%|90%|다양함|56-83|
|DeepSeek-R1 32B|30%|100%|다양함|49-79|
MHI = Model-Harness Index: 50% 도구 호출 + 30% HumanEval + 20% MMLU. "모델이 에이전트 백엔드로 얼마나 잘 작동하는가"를 측정합니다.


