특정 작업에서 Opus보다 Sonnet을 써야 하는 이유 (4.7/4.8 버전)
The case for Sonnet over Opus 4.7 /4.8 (on certain tasks)
핵심 요약
데이터 추출 작업 시 Opus의 과도한 추론과 범위 확장으로 인한 비효율을 경험한 작성자가 Sonnet의 우수성을 주장함.
- 데이터 추출 작업 — Opus의 과도한 추론으로 인해 단순 작업에서 비효율적임
- 모델 성능 비교 — Opus보다 Sonnet이 지시를 더 잘 따르고 군더더기가 없음
- Anthropic의 강화학습 — 모델의 결과물이 예측 불가능해지고 있다는 우려
- 프롬프트 제약 — 엄격한 프롬프트에도 불구하고 모델의 성향을 통제하기 어려움
몇 달 전, 시설/기관의 비정형 웹사이트 문구를 검색 및 필터링 가능한 형식으로 저장하는 대량 데이터 보강 작업을 했습니다. 최소 연령, 제공 서비스, 야외 공간 설명 같은 것들을 추출했고, 사람이 검토할 수 있도록 원문 인용도 포함했습니다.
오늘 새로운 시설을 추가해야 했는데, 저는 Max 플랜을 사용 중이라 기본적으로 Opus를 쓰고 있습니다. 그런데 이 작업에서 정말 미칠 지경이었습니다. 자꾸 멋대로 가정하고, 없는 데이터를 허공에서 지어내고, 작업 범위를 멋대로 확장하려고 하더군요. 모델이 딴짓하지 않게 붙잡아두는 게 제가 해야 할 실제 작업보다 더 힘들었습니다.
몇 달 동안 다듬어온 아주 엄격한 초기 프롬프트를 썼음에도 이 모양이었습니다. Opus는 특정 작업에는 훌륭하지만, 군말 없이 단순한 작업을 수행해야 할 때는 Sonnet이 압승이었습니다.
Anthropic이 진행하는 모든 강화 학습을 보면서, 그들도 결과물이 어떻게 나올지 전혀 감을 못 잡고 그냥 주사위를 던지는 게 아닌가 하는 생각이 강하게 듭니다.

