내가 뭘 놓치고 있는 거지?
What am i not seeing here?
핵심 요약
벤치마크 지표와 실제 업무 효율성 사이의 괴리에 대해 사용자들의 의견이 엇갈리고 있습니다.
- 벤치마크 신뢰성 — AA 인덱스가 실제 일상 업무의 효율성을 대변하지 못한다는 지적이 많음
- 모델 선택 기준 — 복잡한 작업에는 Opus, 단순 반복 업무에는 Sonnet이 적합하다는 의견
- 비용 효율성 — 캐시 읽기 비용 때문에 Sonnet이 항상 저렴한 것은 아니라는 분석
- 실제 체감 성능 — 벤치마크보다 본인의 직접적인 사용 경험이 더 중요하다는 주장
AA index가 현재 우리가 가진 성능 지표 중엔 제일 나아서, 난 무조건 거기만 본다.
대화나 오케스트레이션, 혹은 지능이 별로 필요 없는 작업이 아닌 이상 Sonnet 쓸 이유가 전혀 없음. Opus가 돈도 덜 들고 성능도 더 잘 나오거든. Sonnet 가격을 한 20~30%는 더 낮춰야 하지 않나? 안 그러면 그냥 Opus한테 다 잡아먹힐 텐데.
뭐 평균적인 작업 속도는 좀 더 빠르니까 그건 장점이긴 하네.
