나만 그런가, 아니면 Muse Spark 이거 벤치마크 점수만 엄청 높은 거임?
Is it just me or does muse spark feel incredibly benchmaxed?
핵심 요약
Muse Spark의 벤치마크 성능과 실제 코딩 체감 성능 간의 괴리에 대한 사용자들의 의견 공유.
- 성능 괴리 — 벤치마크 점수는 높지만 실제 코딩 체감은 그에 미치지 못한다는 의견이 많음.
- 가격 경쟁력 — 저렴한 기여자(contributor) 요금제 덕분에 가성비 면에서 높게 평가됨.
- 모델 비교 — DeepSeek나 GLM Flash 등 다른 모델들과의 성능 차이에 대한 사용자별 체감이 갈림.
- 에이전트 활용 — 다수의 서브 에이전트를 활용한 복잡한 작업에서 의외의 성능을 보여준다는 후기 존재.
벤치마크 결과만 보면 무슨 frontier fable이나 astra 경쟁자급인 것처럼 나오는데, 막상 opencode에서 돌려보니까 후하게 쳐줘도 딱 sonnet 5 모델 수준이던데 이거 나만 이러냐? 아니면 내가 제대로 못 쓰고 있는 거임?

