워크로드에 맞는 Claude 모델을 고르는 방법을 정리했습니다. 모델 등급별 특성을 비교하고, 작업당 비용과 토큰당 비용 간의 트레이드오프를 따져보며, 최적 모델을 확정할 평가(evals) 체계를 구축하는 방법까지 다룹니다.
"이 워크로드에는 어떤 모델을 써야 하나요?"라는 질문을 가장 많이 받습니다. 모델 등급과 버전이 늘어나면서, 이 질문에 대한 답도 점점 더 세밀해지고 있습니다.
이 글에서는 각 모델 등급에 대한 설명, 모델 선택 시 고려해야 할 핵심 질문들, 그리고 주요 모범 사례까지 자세히 다룹니다.
다만 세부 사항에 앞서, 기본 권고 사항을 먼저 말씀드리겠습니다. 현재 출시된 모델 중 가장 뛰어난 모델부터 시작하고, 에포트 레벨(effort level)로 성능과 비용을 조정하세요.
토큰당 가격이 높더라도, 더 뛰어난 모델이 작업당 비용은 오히려 낮은 경우가 많습니다. 특히 낮은 에포트 레벨에서 이런 경향이 두드러집니다. 성능이 좋은 모델일수록 대부분의 작업을 더 적은 턴(turn)과 더 짧은 추론 시간으로 처리하기 때문입니다. 또한 작은 모델부터 시작하면 모델 자체의 한계인지, 설정상의 문제인지 구분하기가 어려워집니다.
물론 지연 시간(latency)이나 비용에 민감한 케이스가 생기면, 하위 모델들을 테스트해 가며 최적의 선택을 찾아가면 됩니다.
반대로 가장 비용 효율적인 모델부터 시작해서 품질 기준을 충족할 때까지 상위 모델로 올라가는 방식을 택하는 조직도 있습니다. 두 가지 접근 방향 모두 모델 선택 관련 문서에서 안내하고 있습니다.
Mythos는 Anthropic의 최고 등급 모델로, 전 분야에 걸쳐 최첨단 성능을 자랑합니다. 코딩, 장기 에이전트 작업, 그리고 기존 AI가 안정적으로 처리하지 못했던 문제들을 해결하는 데 특히 뛰어납니다.
Mythos 등급은 동일한 기반 모델을 두 가지 패키지로 제공합니다. Claude Mythos는 이중 사용(dual-use) 사이버보안 및 생물학 분야 업무를 다루는 신뢰 기관(trusted organizations)용이며, Claude Fable은 일반 대중이 안전하게 사용할 수 있도록 추가 안전장치를 갖춘 패키지입니다. 두 모델 모두 안전한 사용을 위해 제한적 데이터 보존 정책이 적용됩니다.
Opus는 추론 집약적인 엔터프라이즈 작업을 위한 고성능 모델 등급입니다. Opus 모델은 지식 업무 분야의 GDPval-AA, 에이전틱(agentic) 코딩 분야의 Terminal-Bench 2.1 등 주요 산업 벤치마크에서 꾸준히 상위권을 유지하고 있습니다.
Opus와 Fable은 코딩, 장기 에이전트 작업, 지식 업무 모두에서 뛰어난 성능을 보여 언뜻 구분이 쉽지 않습니다. 하지만 실제 업무 환경에서는 벤치마크 점수가 비슷하더라도, Fable처럼 더 큰 모델이 판단력, 창의성, 글쓰기 능력에서 앞서는 경향이 있습니다.
일반적인 기준은 이렇습니다. 평가(evals)나 내부 테스트에서 Opus가 일부 작업에 어려움을 겪는다면 Fable이 답입니다. Opus가 이미 품질 기준을 충족한다면, Opus의 빠른 속도와 가격 경쟁력이 더 나은 선택이 될 수 있습니다.
Sonnet 은 일상적인 작업에 두루 활용할 수 있는 범용 모델 등급입니다. 가장 넓은 범위의 범용 케이스에서 성능, 비용, 속도의 균형을 잡아주며, 멀티 에이전트 오케스트레이션 환경에서 대량의 서브 에이전트를 운용할 때도 적합합니다.
Haiku는 가장 저렴하고 빠른 모델 등급입니다. 지연 시간과 비용이 중요한 고빈도 워크로드를 위해 설계되었습니다.
Claude 모델 등급은 특정 업종에 특화되어 있지 않습니다. 금융에는 이 모델, 과학에는 저 모델을 추천하는 방식이 아닙니다. 모든 Claude 모델은 코딩, 에이전틱 작업, 지식 업무 등 다양한 분야에서 뛰어난 성능을 발휘하도록 훈련되었습니다.
모델 등급 간의 핵심 차이는 얼마나 어려운 문제를 안정적으로 처리할 수 있느냐, 그리고 그 성능이 가격과 속도 측면에서 어느 정도의 비용을 수반하느냐입니다. 모델을 선택할 때는 다음 질문들을 점검하세요.
이 작업은 얼마나 어려운가? 일반적으로 시간이 많이 걸리거나, 여러 단계를 거치거나, 기존에 해결되지 않은 문제라면 더 상위 등급의 모델이 적합합니다.
지연 시간 요구사항은 무엇인가? 대고객 서비스처럼 고빈도 워크로드에 모델이 투입된다면, 대체로 Sonnet이 최선의 선택입니다.
접근 제약 조건은 무엇인가? Mythos는 Project Glasswing에 참여한 조직에만 제공됩니다. 또한 모든 조직이 모든 역할에 모든 모델 등급을 허용하는 것은 아닙니다.
단위 경제성(unit economics)은 어떤가? 대량 프로덕션 환경에서는 하위 등급 모델이 더 적합할 수 있습니다. 특히 평가를 통해 해당 작업이 충분히 수행된다고 확인된 경우라면 더욱 그렇습니다. 모델마다 토큰당 가격이 다르며, 성능과 에포트 레벨에 따라 작업당 비용도 달라집니다.
에포트 레벨 역시 품질·속도·비용의 균형에 영향을 미칩니다. 상위 등급 모델을 높은 에포트 레벨로 사용할 때 최고의 성능을 기대할 수 있으며, 상위 등급 모델을 낮은 에포트 레벨로 활용하면 소형 모델보다 오히려 더 효율적인 경우도 있습니다.


자세한 내용은 Claude Code에서 Claude 모델과 에포트 레벨 선택하기를 참고하세요.
어드바이저 전략(advisor strategy)은 빠르고 저렴한 실행 모델이 필요할 때만 더 뛰어난 모델을 호출해 계획을 검토하고 결과를 평가하게 하는 방식으로, 전반적인 성능을 끌어올립니다.
실행 모델이 필요한 순간에만 코칭을 받는 이 방식은 성능을 상당히 향상시킵니다. 실제 사례로, SWE-bench Pro에서 Fable 5를 어드바이저로 활용한 Sonnet 5는 Fable 5 단독 사용 대비 63% 수준의 비용으로 Fable 5 점수의 10% 이내 성능을 달성했습니다.
모델의 성능이 요구 수준에 부합하는지 확인하는 대표적인 방법으로는 표준 벤치마크와 커스텀 평가, 두 가지가 있습니다.
벤치마크는 특정 도메인을 대상으로 답이 정해진 과제나 시나리오를 모아 놓은 것으로, 모델 등급과 공급사를 비교하는 데 유용한 방향 지표가 됩니다. 다만 Opus나 Fable처럼 강력한 모델을 평가할 때는 문제가 생깁니다. 이런 모델들은 테스트의 거의 모든 문제를 풀어버려 벤치마크가 포화(saturation) 상태에 이르기 때문입니다.
이런 경우에는 실제 워크로드에 모델을 직접 투입하거나, 자체 평가를 설계해 어느 모델이 적합한지 판단하는 방식을 권장합니다. 통상적으로 평가는 프로덕션에서 추출한 엄선된 문제 집합으로 구성합니다. 현재 도구가 부족함을 보이는 어려운 작업들을 포함하고, 팀이 직접 성공 기준을 정의합니다.

바로 이 지점에서 최전선 모델들의 성능과 창의성이 다른 모델들과, 그리고 서로 간에도 차별화되기 시작합니다. 커스텀 에이전트 평가 개발 모범 사례에 대해서는 별도의 상세 문서를 마련해 두었습니다.
AI 모델 선택에 모든 상황에 통하는 단 하나의 정답은 없습니다. 바로 그렇기 때문에 여러 모델 등급을 제공하는 것입니다. 결국 최선의 모델을 고르려면 각 모델 등급의 특성을 이해하고, 자신의 유스케이스를 깊이 파악해야 합니다. 그리고 그 출발점은 탄탄한 평가 체계를 구축하고, 지속적으로 유지·발전시키는 것입니다.