펠리컨은 잊어라, 이제는 바구미(Weevil) 타임이다! / 벤치마킹 방지용 SVG 및 비전 벤치마크
Forget the Pelican, it's Weevil-Time! / Benchmaxxing-Proof SVG and Vision Benchmark
핵심 요약
기존 펠리컨 벤치마크를 대체할 새로운 바구미 이미지 기반의 SVG 생성 비전 벤치마크를 제안합니다.
- 벤치마크 대안 — 기존 펠리컨 이미지보다 학습 데이터 오염에 강한 바구미 사진을 테스트용으로 도입함
- SVG 생성 성능 — Qwen3.8-27B 모델을 활용해 이미지를 SVG로 재현하는 비전 성능을 테스트함
- 최적 설정 공유 — 1024 토큰, xhigh 추론 강도, bf16 캐시 설정에서 가장 우수한 결과가 도출됨
- 양자화 영향 — q4_0 캐시 사용 시 출력 품질이 심각하게 저하되는 현상을 확인함
아티스트: Qwen3.8-27B-UD-Q3_K_XL, q8_0 캐시, xhigh, 온도 1.0, image-min-tokens 1024, froggeric 템플릿
Qwen3.8-27B 양자화 모델 이것저것 만져보다가, 아주 단순해 보이면서도 벤치마크 꼼수(benchmaxxing)가 잘 안 통할 것 같은 SVG 및 비전 테스트를 하나 생각해냈음.
그냥 모델한테 Recreate as SVG라는 프롬프트 던져주고 아무 이미지나 SVG로 다시 그려보라고 시키면 됨.
펠리컨 같은 건 벤치마크 꼼수로 쉽게 통과할 수 있는데, 무작위 사진을 똑같이 재현하는 건 학습시키기가 훨씬 빡세 보임.
더 복잡한 프롬프트도 존나 많이 써봤는데, 내 생각엔 위에 적은 게 제일 깔끔하게 잘 먹힘. --image-min-tokens도 512부터 4096까지 바꿔보고, 추론 수준도 없음부터 xhigh까지, 온도랑 kv-캐시도 다 다르게 설정해 봄.
예비 결과로는 --image-min-tokens 1024에 --reasoning-effort xhigh, --temperature 1.0, --cache-type-k bf16, --cache-type-v bf16 조합이 제일 잘 나옴. 추론 안 쓴 결과물은 내가 돌릴 수 있는 양자화 모델(Q3, Q4) 기준으로는 진짜 기괴할 정도임...
채팅 템플릿도 결과물 퀄리티에 영향을 주는 것 같은데, 심심하면 한번 확인들 해보셈.
재밌는 건 kv-캐시 q8_0은 결과가 "좋게" 나왔는데, q4_0은 결과물을 완전히 박살 내버림(사방에 곤충 다리 같은 게 튀어나오는데... 내가 뭘 본 건지 진짜 끔찍했음). q4_0 캐시는 절대 쓰지 말라는 걸 시각적으로 아주 확실하게 깨달았음!
Q6에서 BF16 모델 양자화 버전은 이 작업에서 어떻게 나올지 궁금함. VRAM 넉넉한 형들은 뭔 말인지 알지? ;)
사용한 양자화 모델:
- Qwen3.8-27B-UD-Q3_K_XL (V2)
- Qwen3.8-27B-UD-Q4_K_XL (V2)
사용한 템플릿:
- built in
- qwen3.8-froggeric-v22.3.1
시도해 본 다른 프롬프트:
- Analyze thoroughly and be very detailed about perspective, composition, proportions, colors etc. Recreate as simplified but true to the original SVG
- Analyze perspective, composition, colors and detail. Copy as simplified but true to the original SVG
- recreate as svg. simplify but make it recognizable
- Make a SVG copy
- Copy as SVG
- Recreate as simplified but true to the original SVG


