Composer 2.5는 여전히 SOTA 모델과는 거리가 멉니다
Composer 2.5 is still nowhere near SOTA models
핵심 요약
Composer 2.5의 속도는 인상적이지만, 복잡한 프로젝트에서는 잦은 오류와 회귀 문제로 인해 SOTA 모델에 비해 성능이 크게 떨어집니다.
- 성능 한계 — 복잡한 프로젝트에서 잦은 버그와 회귀 오류 발생
- 마케팅 과장 — 홍보에 비해 실제 실무 효율성은 기대 이하
- 모델 비교 — GPT-5.5 대비 복잡한 작업 처리 능력 부족
- 사용성 평가 — 단순 작업에는 유용하나 고난도 작업은 무리
Cursor가 Composer를 통해 나아가는 방향성은 진심으로 마음에 듭니다. 2.5 버전은 이전 버전들에 비해 훌륭하고, 'fast' 모드는 말도 안 될 정도로 빠릅니다.
하지만 안타깝게도, 제 생각에는 아직 갈 길이 멀었습니다.
오늘 저는 금융 분야의 꽤 복잡한 프로젝트를 작업 중이었습니다. WebGL, Lightweight Charts, PixiJS, uPlot, Kafka 등 수많은 요소가 얽혀 있었죠. 팀 전체가 엄격한 SDD(Spec-Driven Development)를 따르고 있어서, 단순히 "대충 고쳐줘" 같은 모호한 프롬프트가 아니었습니다.
저는 전체 변경 사항에 대한 매우 구체적인 세부 사항이 담긴 완벽한 명세서를 작성했습니다.
Composer 2.5를 벤치마크하기 위해, 계획 모드에서 해당 명세서를 실행하게 한 뒤 코드를 작성하도록 했습니다. 약 5,000줄의 코드가 변경되었는데, 그 과정에서 발생한 회귀 오류와 버그는 솔직히 말도 안 되는 수준이었습니다. 갑자기 버그가 튀어나오고, 여러 단위 테스트가 깨졌으며, Vitest 오류를 해결하려 할 때마다 코드를 엉망으로 만들어 일부 테스트만 통과시키고는 다른 곳에 더 심각한 회귀 오류를 만들어냈습니다.
그야말로 악몽이었습니다.
거의 한 시간 동안 제대로 기회를 줬음에도 인내심이 바닥나서, 결국 하드 리셋을 했습니다. 그리고 Cursor 내부에서 GPT-5.5 High 모드를 사용해 똑같은 명세서를 실행했습니다.
한 번에 성공했습니다.
그 후 약간의 UI 수정만 거쳤을 뿐입니다. 실제 기능은 완벽하게 작동했고, 단위 테스트나 e2e 테스트 실패도 전혀 없었습니다.
Composer가 잘되기를 진심으로 바랍니다. 토큰을 아끼기 위한 단순 작업에는 분명 계속 사용할 것입니다. 하지만 복잡한 작업에 있어서는 안타깝게도 여전히 형편없는 수준입니다.

