비과학적인 Qwen 3.8 Flash Next와 GLM 5.3 Flash 비교
an unscientific qwen 3.8 flash next and glm 5.3 flash comparison
핵심 요약
Qwen과 GLM 모델을 활용해 이미지 기반의 게임/기술 데모를 생성해 본 비과학적 비교 실험기입니다.
- 모델별 접근 방식 — Qwen은 소프트웨어 렌더러를 직접 구현했고 GLM은 Canvas 2D를 활용함
- 지시 이행 능력 — GLM이 시각적 유사성 측면에서 더 나은 결과를 보여줌
- 반복 작업 성능 — Qwen은 작업 완료를 서두르는 경향이 있고 GLM은 지속적으로 개선함
- 실험 환경 — 두 모델 모두 4비트 양자화 상태에서 테스트됨
r/stablediffusion에 올라온 최근 게시물에서 참조 이미지를 하나 훔쳐왔다. 그리고 qwen 3.8 flash next (q4 K XL)랑 GLM flash (oQ4e MLX) 둘 다한테 이걸 "비디오 게임이나 테크 데모"로 최대한 똑같이 구현해 보라고 시켰다. 각각 한 시간 반 정도씩 계속 반복해서 돌려봤음.
전반적으로 GLM flash가 스케일 면에서는 참조 이미지랑 훨씬 비슷했다. 물론 사람 크기 같은 건 아직 갈 길이 멀긴 한데, 처음부터 디테일이 더 살아있더라. 근데 이건 모델들이 접근 방식을 다르게 잡아서 그런 것 같기도 함. 따로 지시한 적 없는데 qwen은 소프트웨어 렌더러를 처음부터 새로 짰고, GLM은 Canvas 2D를 쓰기로 했거든.
그래서 GLM한테 만든 걸 애니메이션으로 만들어 보라고 시켰다(위의 첫 번째 gif/네 번째 이미지). 브라우저 콘솔 에러 하나 고치라고 말해야 하긴 했지만, 참조 이미지를 바탕으로 238k 토큰(대충 총 2시간 정도 걸림) 만에 플레이 가능한 픽셀 아트 "워킹 시뮬레이터"를 만들어냈다. 심지어 계속 디테일 추가하고 개선하려는 의지가 꺾일 기미가 안 보이더라.
전체적으로 보면 지시 이행 능력은 GLM에 살짝 더 점수를 주고 싶다. 프롬프트에서 상호작용보다는 시각적 유사성을 훨씬 강조했는데, GLM이 참조 이미지를 따라가는 걸 훨씬 잘했거든.
qwen은 rtx pro 6000이랑 unsloth gguf 환경에서 10분, 80k 토큰 만에 꽤 괜찮은 픽셀 아트 도시 애니메이션을 뽑아낸 점은 인정함.
근데 qwen은 "목표에 따라 개선할 여지가 있다면, 더 이상 개선할 게 없을 때까지 계속하라"는 지시를 무시했거나 이해를 못 한 것 같다. 지시문을 살짝 바꿔서 다시 돌려봤을 땐 내가 멈출 때까지 80분 동안 계속 반복하긴 했는데, 그래도 참조 이미지랑은 별로 안 닮았더라(뭐, 귀여운 픽셀 아트 도시가 하나 더 나오긴 했음).


