Claude보다 3배나 느린 작업 속도
Tasks take 3 times as long as Claude
핵심 요약
벤치마크와 달리 실제 작업 속도가 너무 느리고 성능도 기대에 미치지 못해 실망스럽다는 사용자들의 불만.
- 작업 속도 불만 — 벤치마크와 달리 실제 속도가 Claude보다 3배나 느려 업무 효율이 크게 떨어짐.
- 모델 성능 저하 — Astra에 비해 긴 문맥 이해도가 떨어지고 의도 파악을 제대로 못 하는 경우가 발생함.
- 구독 모델 혼란 — API 가격과 구독제 사용량 간의 차이로 인해 비용 효율성 판단이 어려움.
- 벤치마크 신뢰도 — 속도와 성능 지표가 실제 사용자 경험과 괴리가 있어 개선이 필요함.
솔직히 벤치마크 점수 보고 제대로 낚였다.
속도가 Anthropic이랑 비슷할 거라더니, 개뿔. 60 tps는 어디다 팔아먹었냐??? 구독해서 써보니까 18 정도 나오더라. 장난하나 진짜. 그래, 똑똑하긴 해. 가격도 싸고. 근데 속도가 뒤지게 느려. 6.1 xHigh로 작업 하나 돌렸는데 무려 5시간이나 걸렸다. 빡쳐서 그냥 재미로 그 프로젝트 커밋 되돌리고, 다른 디스크에 숨겨두고(이게 필요한지도 모르겠는데 그냥 꼼수 부리는 거 보기 싫어서) Opus 5.5 High에 던져봤거든? 1시간 반 만에 끝내더라. 심지어 결과물도 더 나음. 왜 내가 세 배나 더 기다려야 하는 건데? 이게 대체 무슨 상황이냐고. 내가 15시간 자고 일어나도 이거는 프롬프트 3개도 못 끝낼 텐데, 그 시간에 Claude는 10개는 돌리겠다. 이제 "시간당 프롬프트 처리량" 벤치마크 좀 만들면 안 되냐? 아니면 누가 이거 좀 제대로 테스트 안 해주나?
정신 좀 차려라 진짜. 인정할게, 벤치마크 점수만 보고 써보지도 않고 빨아댄 거 내 잘못이다(내 레딧 기록 보면 쪽팔려서 죽을 것 같음). 근데 요즘은 지능 수치만 뻥튀기하는 게 아니라 속도까지 벤치마크용으로 조작질하는 거냐? 진짜 어이가 없네.
그리고 Astra랑 지능 수준이 비슷하다고 말하고 싶은데, 솔직히 전혀 아닌 것 같다. Astra 출시 때부터 주구장창 써대느라 내 "프롬프트 엔지니어링" 실력은 다 죽었는데, 결과물 퀄리티는 하나도 안 떨어졌었거든. 내가 보내는 건 다 찰떡같이 알아먹고, 진짜 장기적인 맥락 파악도 잘했단 말이지. 근데 6.1 Sol은 의도 파악부터가 영 꽝이야. 내 영어 실력 퇴화시켜놓고 이런 개느려터진 쓰레기를 던져주다니, 이건 범죄 수준이다.
게다가 장기적인 맥락 파악도 Astra에 비하면 한참 모자라. 내가 시킨 걸 완전히 잘못 이해한 적이 한두 번이 아니다. 처음 겪었을 때는 진짜 당황스럽더라. Sol 쓸 때 이후로 한 달 반 동안은 이런 적이 한 번도 없었거든. 지난 한 달 동안은 Astra만 썼는데, 걔는 절대 이런 실수 안 했단 말이야.

