Haiku 3.5, Luna, DeepSeek Flash, Gemini 3.8 Flash를 실무 환경에서 테스트해 봄. 품질은 거의 비슷하지만 속도 차이가 큼
I Tested Haiku 5.5 vs Luna vs DeepSeek Flash vs Gemini 3.8 Flash on real-ish work stuff. Basically a tie on quality, big differences in speed
핵심 요약
다양한 소형 모델을 실무 데이터로 테스트한 결과, 품질은 대동소이하나 모델별로 강점과 속도 차이가 뚜렷함.
- 모델별 성능 비교 — 코딩, 수학, SQL 등 11개 카테고리에서 86개 질문으로 테스트함.
- Haiku 5.5 강점 — 가장 빠른 속도를 자랑하며 코딩과 수학 작업에 매우 뛰어남.
- Gemini 3.8 Flash 강점 — 다른 모델 대비 툴 호출(tool calling) 능력이 압도적으로 우수함.
- DeepSeek Flash 강점 — 긴 문서 처리에서 가장 완벽한 성능을 보여줌.
나 나름대로 커스텀 하네스까지 갖춘 엄청나게 큰 규모의 플릿/오케스트레이터 환경을 돌리고 있거든. 거의 모든 제공업체의 모델을 다 써보고 있어서, 새로운 모델 나오면 내 작업 환경에서 어떻게 돌아갈지 확인하려고 나만의 테스트를 꼭 돌려봐. 그래서 이번에 Haiku 5.5를 내가 평소에 쓰는 다른 작고 빠른 모델들(Luna vs DeepSeek Flash vs Gemini 3.8 Flash)이랑 비교해 봤음.
코딩, 버그 수정, 코드 리뷰, SQL, 지저분한 텍스트에서 데이터 추출, 수학, 긴 문서, 툴 콜링, 고객 응대(영어+스페인어), 안전성 등 11개 카테고리에 걸쳐 86개 질문으로 테스트했다.
전부 내 평소 업무랑 비슷한 가상 데이터로 돌렸고, 각각 3번씩 반복함. 가능한 건 자동으로 채점했고, 주관식은 Opus한테 블라인드 테스트로 채점 맡겼음.
100점 만점 전체 점수:
- DeepSeek Flash 86.6
- Luna 85.2
- Gemini 3.8 Flash 85.1
- Haiku 5.5 84.7
결론부터 말하면 품질은 다 거기서 거기임. 차이는 각자 뭘 잘하느냐인데:
- Haiku 5.5: 이 중에서 제일 빠름(중앙값 3.5초). 코딩, 버그 수정, SQL, 수학은 거의 완벽함. 근데 툴 콜링이랑 안전성은 좀 약함. 대량 작업용으로 굴리기엔 딱임.
- DeepSeek Flash: 근소한 차이로 전체 1등, 긴 문서 처리는 완벽함. 근데 최악의 경우엔 속도가 좀 느리고, 가끔 지 혼자 꼬여서 아무것도 출력 안 할 때가 있음.
- Luna: 유료 API 중에 제일 쌈. 전반적으로 무난한데 긴 문서 처리가 제일 약함.
- Gemini 3.8 Flash: 툴 콜링은 다른 애들보다 압도적으로 좋음(81점 vs 50점대). 근데 속도가 압도적으로 느리고(중앙값 11초), 안전성도 제일 구림.
참고: 가상 데이터로 돌린 소규모 테스트라 2점 차이는 오차 범위라고 보면 됨. Haiku는 구독제로 돌려서 비용은 $0으로 잡혔고, 전체 테스트 비용은 API 사용료로 한 4달러 정도 나옴.
아래 보고서가 다들 도움 됐으면 좋겠다!
전체 보고서는 여기 - https://claude.ai/artifact/SEHMk78LcN3QNkpLQ6wLLV



