Haiku 5.5, Sonnet 5.5, Opus 5.5를 서브 에이전트로 6가지 실제 작업에 테스트해 봄
I tested Haiku 5.5, Sonnet 5.5 and Opus 5.5 as subagents on 6 real tasks
핵심 요약
Claude 5.5 모델별 성능과 비용을 비교한 테스트 결과, 코드 검색은 Haiku가 효율적이고 연구 및 팩트체크는 Opus가 우수함.
- 코드 검색 성능 — Haiku가 Opus와 대등한 정확도를 보이면서 비용은 훨씬 저렴함
- 웹 연구 및 팩트체크 — Opus가 가장 정확하며 Haiku는 오류가 많아 신뢰도가 낮음
- 모델별 활용 전략 — 코드 검색은 Haiku, 연구는 Opus, 단순 작업은 Sonnet 사용 권장
- 사용자 경험 공유 — 커뮤니티에서도 Opus의 연구 정확도가 더 높다는 의견이 지배적임
내 프로젝트에서 Opus 5.5가 이미 끝낸 작업 6개를 골라서 Sonnet 5.5랑 Haiku 5.5로 다시 돌려봤다. 전부 다 'high effort' 설정으로 했고, 프롬프트랑 파일도 똑같이 썼음. 결과는 전부 실제 정답이랑 대조해서 확인했다.
코드 검색 (새 기능 추가하려고 수정해야 할 파일 전부 찾기):
- 실제 변경된 파일 48개 중 찾은 개수: Opus 45개, Sonnet 44개, Haiku 44개
- 비용: Opus $6.17, Sonnet $1.38, Haiku $0.44
- 품질은 다 똑같으니까 가성비는 Haiku 압승임
웹 리서치 (작업 3개, 공식 규칙집이랑 구글 고객센터 페이지랑 대조):
- 틀린 정보: Opus 1개, Sonnet 3개, Haiku 10개
- 구글 플레이 계정 규칙 관련, 핵심 사실 12개 중: Opus 12개 정답, Sonnet 9개, Haiku 5개
- Haiku는 리그 공식 규칙집 PDF를 못 열어서 지난 시즌 규칙을 가져다 씀
블로그 포스팅 전 팩트체크 (글 2개):
- 진짜 오류 찾아낸 개수: Opus 8개, Sonnet 7개, Haiku 4개
- 멀쩡한 문장을 오류라고 잘못 짚은 개수: Opus 0개, Sonnet 6개, Haiku 30개
- Haiku 말만 믿었으면 멀쩡한 글 절반을 날려 먹을 뻔함
웹 작업 5개 총비용: Opus $3.93, Sonnet $1.59, Haiku $0.12
지금 내가 쓰는 방식:
- 코드 검색은 Haiku
- 리서치랑 팩트체크는 Opus
- 자잘한 실수 좀 섞여도 되는 건 Sonnet
혹시 리서치 쪽으로 Sonnet이랑 Opus 비교해 본 사람 있냐? 내 결과가 다른 사람한테도 똑같이 나오는지 궁금하네.


