Prism-ML Bonsai 2, Qwen3.8 양자화 비교에 합류
Prism-ML Bonsai 2 Joins Our Qwen3.8 Quantization Comparison
핵심 요약
ByteShape가 Qwen3.8 기반의 Bonsai 2 모델을 자체 벤치마크로 평가하여 기존 모델들과 성능을 비교했습니다.
- 모델 평가 — Qwen3.8 기반 Bonsai 2 모델의 성능을 자체 벤치마크로 검증함
- 평가 방법 — 일관된 벤치마크 환경과 런타임을 사용하여 모델 간 공정한 비교를 수행함
- 성능 지표 — 품질, 모델 크기, 처리량 간의 균형을 중점적으로 분석함
- 결과 공유 — 다양한 환경에서 모델을 비교할 수 있는 공통 참조 지점을 제공함
안녕 r/LocalLLaMA 형들,
Prism-LM에서 최근 Qwen3.8 기반의 Bonsai 2 QAT 모델들을 내놨는데, 반응이 꽤 뜨겁네. 우리 평가 결과로는 이 모델들이 처리량(throughput)이랑 품질 사이에서 꽤 괜찮은 밸런스를 보여주고 있고, 우리 복합 벤치마크 기준으로는 대략 91.5% 정도 찍히더라.
우리가 다른 Qwen3.8 모델들 평가할 때 쓰는 방식이랑 똑같이 돌려보면 어떨까 싶어서, Bonsai 2도 우리 벤치마크 스위트로 직접 돌려봤어.
중요한 거 하나 말해두자면, 이건 우리가 직접 평가한 결과지 Prism 측에서 발표한 벤치마크 수치가 아니야.
Prism의 포크/런타임을 사용해서 모델을 돌렸고, 워크로드나 벤치마크 스위트, 평가 방법론은 우리가 다른 모델 비교할 때 쓰는 기준 그대로 유지했어.
평가는 Instruct랑 Thinking 벤치마크를 따로 진행했어. Thinking 쪽은 권장 샘플링 파라미터를 적용해서 **중간 정도의 사고 노력(medium thinking effort)**을 설정했지.
Bonsai 2가 요즘 Qwen3.8 생태계에서 꽤 비중 있게 다뤄지길래, 다들 어떤 옵션이 나은지 비교할 때 참고할 만한 공통 기준점을 만들어주고 싶어서 추가한 거야.
보통 제공자마다 벤치마크 스위트나 런타임, 추론 설정, 샘플링 파라미터, 평가 방법론이 다 제각각이라 수치를 곧이곧대로 비교하기가 어렵잖아. 그래서 같은 평가 환경에서 돌려본 결과가 품질, 모델 크기, 처리량 사이의 트레이드오프를 이해하는 데 또 하나의 지표가 될 거야.
업데이트된 비교 자료랑 결과는 여기 있어: https://byteshape.com/blogs/Qwen3.8-27B/


