RTX 5090에서 테스트한 Bonsai 2 27B vs Gemma 4 12B vs Qwen 3.5 9B 일본식 탑(pagoda) 생성 비교
RTX 5090 Bonsai 2 27B vs Gemma 4 12B vs Qwen 3.5 9B Japanese voxel pagoda
핵심 요약
Bonsai 2 27B 모델이 동일 메모리 범위 내에서 압도적인 성능을 보였으나, 긴 생성 시간과 높은 토큰 소모가 주요 쟁점으로 떠올랐습니다.
- 모델 성능 비교 — Bonsai 2 27B가 복잡한 장면 생성에서 가장 뛰어난 디테일을 보여줌
- 생성 효율 논란 — Bonsai 2가 다른 모델 대비 15배 긴 생성 시간과 많은 토큰을 소모함
- 하드웨어 최적화 — PrismML 포크를 사용한 테스트 환경에서 모델별 속도 차이가 극명하게 갈림
- 커뮤니티 반응 — 로컬 AI 환경에서의 실사용 가능성에 대해 기대와 우려가 공존함

어제 보니까 prismml에서 qwen 3.8 27b를 엄청나게 양자화한 bonsai라는 모델을 새로 냈더라. fp16 대비 top-1% 정확도가 98%가 넘는다는데, 용량은 Q1 기준 6GB, Q2 기준 8GB밖에 안 됨. 이 정도 메모리 대역에서 다른 모델들이랑 비교하면 어느 정도 수준인지 궁금해서 gemma 4 12B랑 qwen 3.5 9B를 데려와서 테스트해 봤음.
테스트는 전부 rtx 5090에서 돌렸고, 모델들한테 똑같이 pagoda 프롬프트를 줬어. (결과는 원샷 기준임. bonsai가 토큰을 훨씬 많이 쓰긴 했는데, 예산의 90%가 사고 과정에 들어갔거든. 이건 다른 모델들에 비해 이 모델이 얼마나 자율적인지 보여주는 거라 난 오히려 좋게 봄.)
Config
| Setting | Value |
|---|---|
| GPU | 1x RTX 5090 32 GB |
| Runtime | llama-server, PrismML llama.cpp fork, release prism-b10683-d8f26ee, CUDA 12.8 build |
| Why the fork | the Bonsai GGUF doesn't load in stock llama.cpp, so I used the same binary for all three |
| Flags | -ngl 999 -fa on -c 262144 -np 1 --jinja |
| Context | 262,144 tokens for all three |
| Sampling | temp 1.0, top-p 0.95, top-k 20, min-p 0 |
| Thinking | on for all three. Bonsai at reasoning effort xhigh (its default), the other two don't have that setting |
| Output limit | none |
| Runs | one per model |
| Prompt | ~770 words, voxel Japanese pagoda scene in three.js as a single HTML file |
Models and results
| Model | Quant | Size | Output tokens |
|---|


