Haiku 5.5는 단순 저가형 모델을 넘어 메인 코딩 에이전트로 쓸만할까? 직접 테스트해 봄
Is Haiku 5.5 good enough to be your main coding agent, not just the cheap one? I ran a small controlled test
핵심 요약
Haiku 5.5를 다양한 코딩 작업에 테스트한 결과, 중간 수준의 설정에서 Sonnet의 1/20 비용으로 실무에 충분히 활용 가능하다는 결론이 나왔습니다.
- 성능 테스트 — 실제 코드베이스에서 버그 수정, 코드 리뷰, 구현 등 다양한 작업 수행함
- 비용 효율성 — Haiku 5.5 중간 설정이 Sonnet 대비 1/20 비용으로 유사한 성능을 보임
- 설정의 중요성 — 낮은 설정은 검증을 건너뛰고, 높은 설정은 비용 대비 성능 향상이 미미함
- 실무 활용도 — 단순 작업뿐만 아니라 일반적인 코딩 에이전트로도 충분히 viable함
Claude Haiku 5.5를 low, medium, high effort로 설정해서 Sonnet 5.5(medium), GPT-6 Luna(high), GPT-6.1 Sol(medium)이랑 비교 테스트해 봤다. 작업은 실제 중견 규모의 혼합 언어 코드베이스(Rust 코어 + 레거시 스크립팅 레이어)에서 가져왔음.
작업 내용은 다음과 같음:
애매한 버그 리포트 기반의 Rust 버그 수정 2건
심어놓은 버그 9개랑 낚시용 2개가 포함된 코드 리뷰
까다로운 스펙을 요구하는 Rust 구현 2건
"판단력" 테스트: 버그 리포트가 엉뚱한 곳을 범인으로 지목하고 상황을 더 악화시킬 해결책을 요구함, 요구사항 하나는 일부러 애매하게 적어둠
실제 레포에서의 에이전트 작업: 레포의 불문율을 따라 언어 경계를 넘어 로직 옮기기
모델들이 돌기 전에 내가 미리 정답지랑 히든 테스트 케이스를 다 만들어 뒀음.
놀라운 점: 명확하게 정의된 작업에서는 모든 모델이 100점 맞음. Haiku-low가 리뷰에서 컴파일 에러 하나 놓친 거랑, Luna가 애매한 요구사항을 지 맘대로 해석해서 밀고 나간 거(다른 모델들은 이거 지적함) 빼고는 다 똑같았음. 이제 독립적인 코딩 작업으로는 모델들 성능 차이 구분하기가 힘듦.
진짜 차이는 에이전트 작업에서 갈림. Haiku medium은 Sonnet이랑 똑같이 잘함: 코드 정확하고, 테스트 다 통과하고, 레포 관례도 잘 지키고, 지가 확인 못한 부분은 솔직하게 말해주고, 심지어 설계상 트레이드오프까지 스스로 제안함. API 요청 29번 날려서 비용은 약 $0.08 나왔는데, Sonnet은 요청 30번에 정가 기준 약 $1.68 나옴.
다른 effort 설정들은 상태가 좀 별로였음:
Low는 코드는 돌아가게 짰는데 검증 과정을 건너뛰고, 에러 핸들링 폴백도 빼먹고, 테스트 안 한 이유를 지어내기까지 함(15분 걸린 작업을 두고 "빌드가 1시간 넘게 멈춰있었다"고 구라침).
High는 정답은 맞혔는데, 퀄리티 향상은 1도 없으면서 API 요청 385번 날리고 비용만 $1.03 태움.
결론: Haiku 5.5 medium은 단순 작업용을 넘어서 일상적인 코딩 에이전트로 충분히 쓸만함. Sonnet 비용의 20분의 1 수준이니까. 에이전트 작업할 때 low effort는 쓰지 말고, high effort는 돈 낭비니까 거르고, 중요한 릴리즈 작업할 때는 여전히 더 큰 모델 쓰는 게 나을 듯.


