JetBrains가 Claude Fable 5를 어떻게 활용하는지, 그리고 안전장치와 데이터 보존을 프론티어 모델 협업의 핵심으로 여기는 이유를 살펴본다.
JetBrains는 IntelliJ IDEA, PyCharm, Kotlin 프로그래밍 언어 등 전 세계 개발자들이 쓰는 도구를 만드는 회사로, 1,250만 명 이상의 활성 사용자와 Fortune Global 100 기업 중 88곳을 고객으로 두고 있다. JetBrains CTO인 Vladislav Tankov가 Anthropic과 나눈 대화를 통해, 새로운 모델을 어떻게 평가하고 Claude Fable 5 도입 시점을 어떻게 결정하는지, 그리고 프론티어 모델 활용 시 데이터 보존과 안전장치에 대해 어떤 관점을 갖고 있는지 살펴본다.
2026년, JetBrains에게 프론티어 AI는 어떻게 달라졌나?
JetBrains에 합류한 지 10년이 됐는데, 우리는 LLM 공급자들의 초창기 고객 중 하나였다. 지난 1년 사이 큰 변화가 있었다. AI에 회의적이었던 고객들과 사내 구성원들조차 이제는 AI가 사라지지 않을 기술임을 받아들이게 됐다. 기술 산업 전반에서 근본적인 전환이 일어나고 있으며, 회사 내 모든 회의론자들의 생각이 바뀌었다.
새로운 모델은 어떻게 평가하고, 도입 시점은 어떻게 결정하나?
우리는 코딩 회사인 만큼 방대한 평가(evaluation) 파이프라인을 운영한다. 모노레포를 포함한 비공개 저장소에서 대규모 평가 세트를 돌리는데, 공개 벤치마크 점수가 실제 작업에서도 통하는지 꼼꼼히 확인한다. 공개 벤치마크에서 좋은 점수를 내도록 튜닝됐지만 실제 작업에서는 성능이 떨어지는 모델들이 있기 때문이다. 비공개 저장소를 활용하면 이를 훨씬 쉽게 검증할 수 있다. 최고 품질, 작업당 최저 비용, 가장 빠른 모델을 각각 순위로 관리하는 리더보드도 운영 중이다. Claude Fable 5는 토큰당 비용은 더 높지만, 특히 복잡하고 오래 걸리는 작업에서는 작업당 비용이 오히려 낮은 경우가 있다.
이전 모델과 비교했을 때, Claude Fable 5는 평가에서 어떤 성과를 냈나?
Claude Fable 5는 이전 모델들보다 정확도와 효율성 모두에서 앞선다. 우리 평가 스위트에서 Python 통과율 최고치인 44.3%를 기록했는데, Opus 4.8의 28.2%에 비해 16포인트나 높은 수치다. 일대일 비교에서 Claude Fable 5는 Opus 4.8이 풀지 못한 Python 태스크 18개를 해결한 반면, 진 경우는 단 2개에 불과했다. 신뢰도도 더 높다. 코드가 실행됐을 때 두 Opus 모델보다 훨씬 높은 비율로 테스트를 통과했다. 실행은 되지만 잘못된 결과를 내는 코드는 발견하기 가장 어렵고 비용이 큰 유형의 실패인 만큼, 이 부분이 특히 중요하다.
효율성 측면도 주목할 만하다. Claude Fable 5는 Opus 4.8보다 약 22% 적은 단계로 해답에 도달해, 시행착오를 줄이고 더 빠르게 작동하는 코드를 만들어낸다. 노력을 쏟는 곳도 적절하다. Java 태스크에서 Opus 4.8이 우리 환경에서 거의 도움이 되지 않는 외부 리소스를 반복적으로 끌어오려 한 반면, Claude Fable 5는 그런 시도를 아예 건너뛰고 눈앞의 코드에 집중했다. 전반적으로 더 나은 엔지니어링 습관을 보여준다.
다른 모델 대신 Claude Fable 5를 선택하는 경우는 언제인가?
Opus는 믿고 맡길 수 있는 작마(workhorse)로 통한다. 주어진 일을 확실히 해낸다는 신뢰가 있다. 반면 Claude Fable 5는 깊은 추론이 필요할 때, 혼자서 어떻게 해야 할지 확신이 서지 않아 파트너가 필요할 때 선택하게 된다. 예를 들어, 우리 팀의 한 테크 리드가 수년간 몇 차례 시도했던 리치 텍스트 에디터 컴포넌트를 구현하기로 했는데, Claude Fable 5가 거의 한 번에 완성해냈다.
오래 실행되는 에이전틱(agentic) 코딩 실험도 Claude Fable 5의 주요 활용 사례 중 하나다. 텍스트와 이미지 형태의 명세서를 Claude Fable 5 기반 에이전트에 제공하고, 복잡한 IDE 유사 앱을 구현하게 한다. 흥미로운 점은 명세서 자체도 에이전트가 기존 앱을 바탕으로 생성할 수 있다는 것이다. 이 두 가지 기능을 결합하면 거의 블랙박스 방식으로 앱을 한 런타임, 프레임워크 또는 언어에서 다른 것으로 재작성할 수 있다.
현재의 프론티어 모델을 활용할 때 안전성과 데이터 보존은 어떻게 접근하나?
우리가 직접 가장 안전한 모델을 만들려는 회사는 아니다. Anthropic 측에서 진행하는 레드 팀(red teaming) 등의 작업이 모델 안전성을 충분히 보장해준다고 신뢰한다. 우리가 취하는 것은 배포 단계에서의 체계적인 안전 확보 방식이다. 모델 자체를 건드리는 것이 아니라, 모델과 하네스(harness)를 둘러싼 인프라와 안전망을 구축한다.
보안도 Claude Fable 5의 주요 활용 분야 중 하나다. 자사 제품을 대상으로 화이트박스 테스트를 실행해 취약점을 찾아낸다. 또한 우리 보안팀은 외부에서도 Claude Fable 5나 이와 동급의 모델을 이용해 자사 모든 제품의 취약점을 탐색할 수 있다는 사실에 대비하고 있다. 규제 산업의 대형 기업들을 고객으로 두고 있는 만큼, 철저한 준비가 중요하다. Claude Fable 5는 우리 보안 작업을 가로막는 것이 아니라 뒷받침해준다.
결국 팽팽한 균형의 문제다. 분류기(classifier)가 덜 엄격할수록, 아무도 몰랐던 취약점을 포함해 더 많은 취약점이 우리 제품에서 발견될 수 있다.
솔직히 말하면, 데이터 보존은 없는 게 이상적이다. 하지만 무엇이 요청됐는지, 분류기가 어디서 잘못 작동했는지 파악하려면 달리 방법이 없다는 것도 안다. 검토가 가장 심각하게 분류된 사례에 한해서만 이루어진다면 그 정도는 수용할 수 있다. 팀이 최선의 성과를 낼 수 있도록 프론티어 수준의 지능에 접근하는 것과의 합리적인 트레이드오프라고 생각한다.
JetBrains의 AI 로드맵에서 다음 단계는 무엇인가?
LLM 공급자들이 만드는 기반 모델은 계속해서 더 강력해질 것이다. 지금 중요한 것은 소프트웨어 개발을 위한 일종의 콕핏(cockpit), 즉 에이전트와 사람이 협력하고 개발 프로세스를 관리할 수 있는 공간이다.
JetBrains에게 이것은 큰 전환점이다. 우리는 그 콕핏을 구동하는 에이전틱 소프트웨어 개발 라이프사이클 전반에 걸쳐 차세대 제품을 구축할 기회를 보고 있다. 개발자들은 에이전트의 도움으로 더 많고 더 나은 코드를 출시하게 될 것이고, 비기술 직군도 소프트웨어 창출에 더 큰 역할을 맡게 될 것이며, 조직은 필요로 하는 거버넌스와 투자 대비 수익에 대한 명확성을 확보하게 될 것이다.
시작하기: Claude Fable.