Muse Glimmer에 대한 여러분의 경험을 공유해주세요
Please Share Your Experience About Muse Glimmer
핵심 요약
Muse Glimmer 모델의 코딩 성능에 실망한 작성자가 다른 사용자들의 의견을 묻는 글입니다.
- 코딩 성능 논란 — 원샷 코딩 테스트에서 Muse Glimmer가 Qwen 모델보다 낮은 성능을 보임
- 추론 방식의 차이 — 모델이 툴 호출 전 과도한 토큰을 소모하며 반복적인 사고 과정을 거침
- 모델 평가 기준 — 제로샷 테스트가 모델의 실제 추론 능력을 대변하지 못한다는 반론 제기
- 대안 모델 기대 — Qwen 3.8 27B 모델 출시에 대한 높은 기대감 형성
로컬 LLM을 테스트하는 고전적인 방법으로 테스트해봤음. HTML 파일 하나로 8볼 당구 게임을 만들어달라고 했는데, Muse Glimmer가 21k 토큰(128k 전체 컨텍스트 사용 중)을 쓰고도 겨우 220줄짜리 HTML만 만들고는 다 됐다고 하더라. 내 경험상 Qwen 3.6 27B 근처에도 못 미치는 수준임. 이미 Qwen 3.8 27B를 기다리고 있는 상황인데, 이 모델에 대해 어떻게 생각함? 이 테스트 전까진 정말 기대가 컸는데 실망스러움.


