Cognition은 자사의 AI 소프트웨어 엔지니어 Devin에 Claude Fable 5를 도입해 테스트했다. 8시간 동안 사람 개입 없이 실행해도 즉시 배포 가능한 코드를 만들어낼 수 있다고 팀이 처음으로 신뢰한 모델이다.
Cognition은 실리콘밸리 기준으로도 젊은 회사다. 에이전트의 기본 동작조차 불안정했던 2024년 초, 자율 AI 소프트웨어 엔지니어 Devin을 세상에 내놨다.
Devin이 맡는 일은 엔지니어들이 늘 뒤로 미루는 것들이다. 코드베이스 마이그레이션, 쌓여가는 버그, 계속 밀리는 기능 개발. 고성장 스타트업부터 포춘 500대 기업까지 고객사가 다양한 만큼 기준도 높다. Devin이 작성하는 코드는 신뢰할 수 있어야 하고 즉시 배포 가능한 수준이어야 한다. 조용히 스며든 작은 버그 하나가 나중에 큰 문제로 번질 수 있기 때문이다.
Alberti의 팀은 Devin을 구동하는 모델을 직접 훈련하고 테스트하며, 처음부터 거의 모든 Claude 세대를 거쳐왔다. 그가 첫 번째 실질적인 도약으로 꼽는 건 2024년 말에 출시된 Claude 3.6 Sonnet이다. 툴 체이닝을 안정적으로 수행하고 다단계 작업을 이어갈 수 있었던 첫 모델이었다. Devin에 적용하자 내부 사용량이 세 배로 뛰었다.
그런 경험이 쌓였기에 그는 좀처럼 감탄하지 않는다. Cognition은 벤치마크에서 뛰어난 성능을 보인 모델이 막상 엔지니어들이 써보면 무너지는 상황을 반복해서 겪어왔다. "이런 식으로 여러 번 데였습니다"라고 Alberti는 말한다. 그래서 팀은 어떤 점수보다 자사 엔지니어의 판단을 믿는다. 안목이 가장 뛰어난 개발자들이 새 모델을 실제 하루 업무에 투입해보고, 그 코드를 실제로 쓸 수 있는지를 기준으로 삼는다.
Alberti의 말을 빌리면, "우리는 어떤 평가도 믿지 않습니다."
그 모든 발전에도 여전히 하나의 천장이 존재했다. 에이전트가 맥락을 잃지 않고 얼마나 오래 실행될 수 있는가.
"Fable 이전에는 에이전트에게 작업을 맡겨도 몇 분, 길어야 한 시간 정도였습니다"라고 Alberti는 말한다. 그 이후엔 세션이 흐트러졌다. 이전 모델에 다섯 가지 아이디어를 동시에 검토하게 하면 금세 갈피를 잃고 혼란에 빠졌다. 한 데이터베이스 마이그레이션에서는 이전 Opus 모델이 기술적으로는 작업을 완료했지만, 과정에서 미묘한 버그를 여러 개 심어놓기도 했다.
장애 트리아지(triage)에서도 같은 패턴이 반복됐다. 이전 모델들은 로그를 깊이 파고들기보다 표면에 머무는 경향이 있었고, 어떤 상황에서도 답을 내놓도록 훈련되어 있었다. 결국 "처음 발견한 그럴듯한 원인을 자신 있게 주장하고는 멈춰버리는" 식이었다. 엔지니어들은 점점 그 답변을 흘려듣게 됐다.

Cognition은 자체 개발한 벤치마크인 Frontier Code로 모델을 평가한다. 기존 벤치마크들이 테스트는 통과하지만 실제 코드베이스에서는 버티지 못하는 코드에 높은 점수를 주는 경우가 많았기 때문이다. Alberti는 이를 "저품질 방지(anti-slop)" 기준이라고 부른다. 가장 까다로운 하위 항목에서 이전 Opus 모델의 점수는 약 10%였다. Claude Fable 5는 약 30%를 기록했다.
팀의 첫 반응은 의심이었다. "버그가 있는 건 아닐까? 이게 맞을 리가 없는데." 보통 벤치마크 점수가 크게 뛰면 실제로 더 나아진 건지를 두고 엔지니어들이 몇 주씩 논쟁을 벌이기 마련이다. 이번엔 달랐다. dogfooding 결과가 수치와 일치했다. "솔직히 꽤 충격적이었어요"라고 Alberti는 말한다.
"우리가 가장 크게 체감한 건 작업 지속 시간, 즉 얼마나 오래 스스로 작업할 수 있느냐였습니다"라고 그는 말한다. "자려고 누우면서 '그냥 계속 작업해줘, 내가 일어날 때까지 멈추지 마'라고 맡겨둔 적이 있었는데, 일어나보니 여덟 시간 동안 쉬지 않고 실제로 의미 있는 진전을 이루고 있었습니다. 그런 건 처음이었어요."
그 긴 작업 지속력은 Claude Fable 5가 복잡한 컨텍스트 속에서도 명료함을 유지했기에 가능했다. Cognition의 내부 디버깅 툴을 제대로 활용한 첫 모델이기도 하다. 브라우저에서 로그를 넘겨가며 노이즈 속에서도 결론을 도출해냈다. 이전 모델들이 실패했던 마이그레이션에서는 스스로 지켜야 할 불변 조건을 명시한 뒤 그대로 실행했다. 트리아지에서는 근본 원인을 짚어내고, 자신이 확신할 수 없는 부분은 솔직히 밝혔다. Alberti는 바로 그 솔직함이 신뢰를 회복시키는 열쇠라고 말한다.
그는 이번 도약을 대략 일 년에 한 번 찾아오는, 진정한 의미의 단계적 도약 중 하나로 평가한다.

Cognition의 창업 당시 핵심 가설은 에이전트가 클라우드에서 수 시간씩 자율 실행될 수 있어야 한다는 것이었다. 하지만 회사 창립 첫 해에는 모델이 그 수준에 미치지 못했다.
Alberti는 Claude Fable 5가 그 가설을 실현 가능한 것으로 만들어줬다고 말하며, 일부는 이미 제품에 반영되어 있다. Devin은 이제 Slack 채널을 모니터링하다가 직접 태그되지 않아도 이슈에 뛰어들거나, 프로덕션 환경을 감시하다가 급격한 지표 변화를 자체적으로 트리아지할 수 있다. 이런 작업을 제대로 해냈을 때, 그 느낌은 "팀에 실제 엔지니어가 있는 것 같다"고 그는 표현한다.
그는 이것이 엔지니어링 팀의 기본값이 될 것으로 내다본다. 1~2년 안에 에이전트 세션의 90%는 문제를 스스로 발견하고, 코드베이스를 스캔하고, 해결책을 메시지로 전달하는 능동적인 방식으로 운영될 것이라고 그는 말한다.
"회사에서 항상 만들고 싶었던 많은 것들이 이제 가능해졌습니다"라고 Alberti는 말한다.
Claude Fable 5로 시작해보세요.