코딩 테스트: BF16 Muse Glimmer vs BF16 Qwen3.6 27B 비교
Tested in Coding: BF16 Muse Glimmer vs BF16 Qwen3.6 27B
핵심 요약
Muse Glimmer와 Qwen3.6 27B의 코딩 성능을 비교한 결과, Qwen이 복잡한 디버깅과 반복 수정 작업에서 더 안정적인 성능을 보였습니다.
- 진단 품질 — 두 모델 모두 근본 원인 파악 능력은 우수함
- 구현 신뢰성 — Qwen이 수정 과정에서 더 안정적이고 정확함
- 검증 정확도 — 두 모델 모두 자기 검증 과정에서 심각한 오류를 보임
- 지속적 수정 — Qwen은 수정 후 개선되나 Muse Glimmer는 복잡한 버그에서 반복 실패함
다들 이 비교 엄청 기다렸을 거라 생각함. 확실히 해두자면, 두 모델 다 FP16 KV-cache 풀로 돌렸음. VRAM 한계 때문에 Muse Glimmer는 262,144 컨텍스트를 다 썼고, Qwen3.6 27B는 147,500 컨텍스트까지만 가능했음. 둘 다 GPU 오프로드 100% 상태임.
두 모델 다 기업용 웹 애플리케이션 코딩 작업에 투입해 봤음.
각 모델별 상세 보고서 (경고 - AI 생성 콘텐츠 포함):
진단 품질 - 비슷함. 둘 다 제대로 각 잡고 하면 근본 원인 파악하는 실력이 진짜 괜찮음. Qwen은 코딩 문제 찾아내서 깔끔하게 고쳐놨고, Muse Glimmer는 버그 추적 제대로 해서 Frontier 모델이 10번 넘게 검토해도 못 잡은 걸 잡아내기도 함. 진단 능력은 둘 다 꿀릴 거 없음.
구현 신뢰도 - Qwen 승. Qwen도 코딩하다가 회귀 버그(예: zone-scope 리팩토링 회귀, 대소문자 구분 회귀)를 좀 만들긴 했는데, 일단 걸리면 한두 번 수정으로 깔끔하게 고쳐짐. Muse Glimmer도 깔끔하고 스펙에 딱 맞는 수정안을 내놓긴 함. 근데 200k 컨텍스트 넘어가는 복잡한 환경에선 Muse Glimmer가 3번 연속으로 삽질함. 갈수록 지시사항을 구체적으로 줬는데도 근본적인 버그는 하나도 안 고쳐지더라.
자체 검증 정확도 - 둘 다 문제 심각함, 근데 양상이 다름. Qwen은 제일 심했던 게 진단한 버그 없애려고 '인수 조건(Acceptance Criteria)' 자체를 수정하자고 덤빈 거임. 이건 단순 보고 누락이 아니라 데이터 무결성 문제라 이번에 나온 것 중 제일 심각했음. 얕게 검토하다가 설명 안 되는 이상 현상을 보고서에서 슬쩍 빼버린 적도 있고. Muse Glimmer는 패턴이 좀 다름. 진단 테스트에서 실제 파이프라인 출력값엔 있지도 않은 조항을 "✓ 검증 완료"라고 두 번이나 우기더니, 세 번째엔 아예 엉뚱한 파일(실제 출력값이 아니라 인수 조건 파일)을 검증함. 그러고는 지가 새로 만든 버그를 "원래 있던 거임"이라고 딱지 붙이면서, 이게 예상된 동작인 척하며 사실상 포기해버림.
수정 과정에서의 궤적 - 이게 제일 큰 차이점임. Qwen은 지적받으면 보통 고치고 다음 단계로 넘어감. 같은 작업에서 똑같은 실수 반복 안 함.
Muse Glimmer도 쉬운 버그는 똑같이 잘 고침. 근데 복잡한 버그 들어가면 3번 연속으로 똑같은 삽질(조항 누락, 잘못된 ID, 엉뚱한 내용)만 반복함. 주변 잡음만 바뀌지 핵심 버그는 매번 뭘 확인해야 하는지 정확히 알려줘도 끝까지 못 찾음. 결국 엉뚱한 아티팩트 확인하고 멈춰버리는 게 끝임.
최종 평가: 범위가 확실하고 한 번에 끝낼 수 있는 수정 작업이라면 진단 능력은 둘 다 비슷하게 믿을 만하고, 수정 후 처리 능력은 Qwen이 아주 살짝 더 안정적임. 하지만 끈질기게 파고들어야 하는 골치 아픈 버그라면, Muse Glimmer는 Qwen이 보여준 끈기나 자기 교정 능력을 전혀 보여주지 못함.


