Artificial Analysis에 대한 신뢰를 잃었다 - Muse Spark 1.3 하소연
I lost faith in Artificial Analysis - Muse Spark 1.3 rant
핵심 요약
Muse Spark 1.3의 형편없는 코딩 성능과 과도한 토큰 낭비에 대한 사용자의 불만.
- 성능 저하 — Muse Spark 1.3이 복잡한 작업을 수행하지 못하고 잦은 오류를 범함.
- 토큰 낭비 — 비효율적인 코드 작성으로 인해 엄청난 양의 토큰을 소모함.
- 모델 비교 — Deepseek V4.1 Flash가 코딩 작업에서 훨씬 더 나은 성능을 보임.
- 사용자 경험 — 불필요한 기능 추가와 과도한 설명으로 사용자의 의도를 파악하지 못함.
Muse Spark 1.3 점수는 존나 높게 나오길래, 평소 하던 대로 기능 하나 구현하는 계획을 맡겨봤거든? 와, 진짜 가관이다. 벌써 토큰 5억 개를 날려 먹고 8번째 리뷰 단계인데, 코드가 하도 개판이라 아직도 안 끝남.
빌려온 검사기(borrow checker) 에러 뜨니까, 리뷰어한테 한다는 소리가 냄새나는 코드 리팩토링은 나중으로 미뤘다고 보고하더라.
심지어 루프 하나를 백만 번 돌리게 짜놨길래 내가 직접 잡았는데, 고친 방법이... 그냥 단순 나눗셈 한 줄이었음.
리뷰어가 핫 패스(hot path)에서 불필요한 할당이 너무 많다고 지적하니까, 이 새끼가 한 짓이 뭔지 아냐? 할당을 수행하는 헬퍼 함수를 따로 만들어서 핫 패스가 그걸 호출하게 바꿔놨더라.
이런 벤치마크 점수만 높은 쓰레기에 비하면 Luna는 천재 수준임. Deepseek V4.1 Flash는 점수는 더 낮아도 코딩은 훨씬 잘함.
이게 가진 유일한 장점은 저커버그한테 네 코드 다 털리는 대가로 싸게 쓸 수 있다는 거 정도? 뭐, Muse Spark가 뱉어낸 결과물로 학습할 생각이라면 행운을 빈다.


