모델 및 양자화 품질 테스트 결과 - 체스판 SVG (Qwen3.6 27B/35B-A3B/Zaya1)
Models and Quants quality test results - the chessboard svg (Qwen3.6 27B/35B-A3B/Zaya1)
핵심 요약
다양한 모델과 양자화 기법을 사용하여 체스판 SVG 생성 품질을 테스트하고 결과를 공유함.
- 모델 품질 테스트 — Qwen3.6 및 Zaya1 등 여러 모델의 체스판 SVG 생성 능력을 비교함.
- 양자화 영향 분석 — 비트 수에 따른 성능 변화와 로컬 추론 엔진의 한계를 확인함.
- 결과 공유 — 특정 모델은 완벽한 결과를 보였으나, 일부는 시각적 오류나 루프 현상이 발생함.
- 커뮤니티 피드백 — 모델별 벤치마크와 실제 구동 경험을 바탕으로 최적의 모델을 탐색함.
이 내용에 따라, 더 많은 모델과 양자화 버전을 다루기 위해 몇 가지 테스트를 더 진행했다.
https://www.reddit.com/r/LocalLLaMA/comments/1t53dhp/quality_comparison_between_qwen_36_27b/
Qwen 3.6 35B-A3B MLX oQ4의 결과물은 거의 완벽하다. 제목, 마지막 수 라벨, 행과 열까지 모두 포함되어 있다. 하지만 시작점과 끝점을 나타내는 두 개의 커서(빨간색 삼각형)는 처음 볼 때 약간 혼란스럽다.
ZAYA1 8B는 오픈 웨이트 모델이다. 이 PR을 사용하여 MLX-LM으로 실행해 보려 했지만 성공하지 못했다. 8비트 모델은 SVG를 생성하지 못한 채 계속 추론 루프에 빠졌다. 로컬 추론 엔진이 아직 준비되지 않은 것 같다. 모델이 작동하려면 RSA 기술이 필요하기 때문이다. 그래서 Zaya 클라우드 플레이그라운드의 결과를 게시했다. 아마도 FP16 버전일 것이다. 만약 로컬 추론 엔진이 동일한 답을 생성할 수 있다면, 우리 소형 컴퓨터에서 실행할 수 있는 매우 유망한 모델이 될 것이다. 8비트 양자화 모델을 내 컴퓨터에서 실행하는 전체 과정은 12GB 미만의 메모리를 사용한다.
27B의 MLX-oQ 6비트 양자화는 훌륭하고 정확한 답을 내놓았지만, 3.5비트로 밀어붙이는 것은 실패했다.
HY3의 295B는 내 기기에서 감당할 수 없다. 그래서 결과는 클라우드에서 가져왔다.
이제 허깅페이스에 떠돌아다니는 수천 개의 파생 모델들을 사용하는 이상한 영역으로 들어간다. Jackrong, OrionLLM, DavidAU의 모델들을 사용할 것인데, 모두 어떤 형태로든 벤치마크를 발표했고 좋은 결과를 약속했기 때문이다.


