Claude Fable, AI의 또 다른 큰 도약을 알리다
그 이유를 이해하려면 Fable이 일을 처리하는 방식을 살펴볼 필요가 있다. 이를 위해 이전의 여러 AI 모델에서 테스트해온 예시를 하나 들어보겠다. 바로 등시선 지도(isochrone map) 만들기다. 이 지도는 주어진 시간 내에 이동할 수 있는 거리를 시각적으로 보여주는 것으로, 최초의 등시선 지도는 1881년 런던에서의 이동 시간을 나타내기 위해 제작되었다.

이전 모델들은 이런 지도를 만드는 데 절반도 쓸 만한 결과를 내지 못했다. 수천 개에 달하는 이동 거리를 조사해야 하고 수많은 세세한 판단과 결정이 필요한 작업이기 때문이다. 나는 Claude Code에서 Fable로 다음과 같은 프롬프트를 입력해 시도해보기로 했다. 여러 도시를 선택하면 실제 데이터를 기반으로 한 등시선이 표시되는, 완벽하게 조사된 아름다운 등시선 지도를 만들어줘. 디자인은 독창적이어야 해. 공항(공항 오가는 시간 포함), 기차, 도보, 자동차를 모두 고려해야 해. 데이터가 실시간일 필요는 없지만 직접 조사하고 수집한 실제 데이터여야 해. 도시 몇 개로 시작해도 되지만 범위가 넓을수록 좋아. 완전히 새로운 프로젝트로 시작해줘.그러자 AI가 원본 지도의 스타일로 만들어보자고 제안했다. 나는 동의했고, AI는 곧바로 작업에 들어갔다.
AI가 혼자 수 시간 동안 진행한 작업 과정을 담은 로그를 찬찬히 살펴볼 만한 가치가 있다. 꽤 이례적인 장면들이 눈에 띄기 때문이다. 먼저, AI는 이동 시간 조사를 위해 여러 다른 AI(대부분 더 저렴한 Claude Sonnet으로 추정)를 직접 실행해 활용했다. 그 과정에서 2,200건이 넘는 특정 항공편 정보를 수집했고, TGV부터 신칸센에 이르는 열차 시간표와 여러 학술 논문에서 국가별 도로 주행 속도 데이터도 확보했다. 그리고 에이전트들이 조사를 진행하는 동안 Fable은 동시에 코딩을 시작했다. 이후에는 코드를 검증하기 위한 에이전트와 테스트를 추가로 실행하면서, 줄곧 진행 상황을 기록해나갔다.

결과물은 1881년 원본 지도와 상당히 흡사한 모습의, 놀랍도록 정교하게 작동하는 지도였다. 하지만 완벽하지는 않았다. 그린란드 같은 오지의 경우 정확한 수치 대신 이동 시간 추정값만 들어가 있다는 점을 발견했고, Fable에게 수정을 요청하며 이렇게 지시했다. 오지 공항과 지역의 실제 이동 시간을 직접 조사해서 반영해줘. 이번에는 AI가 서로의 결과를 검증하는 대립적 에이전트 그룹으로 구성된 워크플로를 실행했다. 태평양의 핏케언 섬으로 가는 선박 운항 주기를 알아내고, 오타와에서 그리스 피요르드(Grise Fjord)까지 가는 방법도 파악했다. 그리고 아주 짧은 시간 안에 엄청난 양의 토큰을 소비했다(이에 대해서는 곧 자세히 다룰 것이다).

결과는 인상적이었다. 내가 관심 있는 방향으로 몇 차례 더 요청을 추가했다(다른 시각화 방식을 요청하는 것 등). 몇 분만 시간을 내어 이리저리 클릭해보길 권한다. 그래프 하단에는 AI가 사용한 방법론과 출처도 확인할 수 있다.
여행과 지도를 특별히 좋아하는 사람이 아니라면 이 프로젝트가 직접적으로 유용하게 느껴지지 않을 수 있다. 하지만 이 예시는 AI가 리서치, 수학, 시각적 구현, 미적 감각, 판단력, 복잡한 코딩 등 다양한 요소가 복합된 어려운 문제를 해결할 수 있음을 잘 보여준다. 그리고 불안감을 주는 부분은 내가 한 일이 얼마나 적었냐는 것이다. 야심 찬 지시를 하나 던졌더니 AI가 그대로 따랐다. 사소한 피드백 몇 가지를 더했더니 AI가 알아서 해결했다. 나의 역할은 극히 제한적이었다.
중요한 것은, 내가 모델에 비해 한 일이 적었다는 것에 그치지 않는다. 모델이 어떤 방식으로 작업했는지, 왜 특정 접근법을 선택했는지, 심지어 결과를 어느 깊이까지 파고들지에 대해서도 내가 관여할 여지가 거의 없었다. AI의 의사결정 과정은 나에게 보이지 않으며, 설령 보인다 해도 전체 과정을 따라가는 것 자체가 무의미할 만큼 길다. 지도 하나를 만드는 데 AI는 수백 가지 사소한 선택들에 대해 스스로 판단을 내렸고, 나는 그 선택들을 파악하거나 의견을 낼 기회가 없었다. 어떤 면에서는 기적 같은 일이다(마지막에 수정을 요청할 수 있으니까). 하지만 다른 면에서 보면, AI를 궁극의 블랙박스로 만들어버리는 것이기도 하다.
Fable로 진행한 프로젝트 중 가장 야심 찬 것은 조금 더 설명이 필요하다. 나는 사람들의 지저분한 답변을 데이터로 다루는 연구를 많이 한다. 이런 작업에서는 답변을 제대로 분류하는 것이 분석의 전제 조건이 된다. 어떤 아이디어가 얼마나 혁신적인가? 사람들이 이 책을 좋아하는 이유는 무엇인가? 이를 파악하기 위해 기존에는 사람 연구자들이 정보에 대해 판단을 내리고, 그 답변을 다른 사람들의 것과 통계적으로 비교해 데이터의 신뢰성을 검증하는 방식을 써왔다. 최근 많은 연구에서 AI가 이 중요한 작업을 수행할 수 있다는 가능성이 제시되었지만, AI와 인간의 판단을 조율하는 것은 어렵고 비용도 많이 드는 일이었다. 그래서 나는 Fable에게 이 문제를 해결해달라고 요청했다. 먼저 19페이지 분량의 복잡한 설계 문서를 작성하게 한 다음, 그것을 실제로 구현하도록 했다.
AI는 아홉 시간 반 동안 작업했다.

결과물은 AI가 'Concord'라고 이름 붙인 매우 정교한 소프트웨어였다. 여러 데이터셋을 입력받아 인간과 AI의 응답을 조율하고, 그 결과를 바탕으로 복잡한 데이터 분석을 수행할 수 있는 도구였다. 이 역시 완벽하지는 않았다. 전문가로서 내가 설계 과정에서 요청한 방식 때문에 생긴 것들을 포함해 몇 가지 오류와 누락된 부분을 발견했고, AI에게 수정을 요청했다. 하지만 이 프로젝트를 비롯한 여러 작업의 결과물이 보여준 범위와 수준은 내가 이전에 본 것을 훌쩍 뛰어넘었다. 이 경우에는, 연구자들이 오랫동안 필요로 했지만 만들면 수익이 나지 않아 존재하지 않았던 소프트웨어가 탄생한 것이었다. 코드는 지금 바로 사용하거나 수정할 수 있다. 완벽하지 않을 수 있지만(결과물을 다루는 데 한 시간밖에 쓰지 않았으니), 소프트웨어 엔지니어라면 내가 빠르게 발견하지 못한 잠재적 버그를 잡아낼 수 있을 것이다. 이것이 미래에 코더가 더 줄어드는 것이 아니라 오히려 더 필요해질 수 있는 이유 중 하나다. 소프트웨어의 새로운 용도가 폭발적으로 늘어나는 흐름을 따라가려면 사람의 손길이 필요하다.
이런 강력한 성능에는 낯설음과 한계가 따라온다. 한계 중 하나는 토큰 비용이다. Fable은 Opus보다 두 배 비싸며, 토큰을 소비하는 속도를 보면 실제 운영 비용이 "상당하다"고밖에 말할 수 없다. 물론 더 저렴한 모델로 작업을 위임하는 영리한 방식 덕분에 실질 비용은 상당히 낮아질 수 있다. 또한 Fable의 안전장치는 보안 문제의 낌새만 보여도 즉각 반응해 덜 강력한 Claude 4.8 Opus로 전환해버리는데, 이런 일이 지나치게 자주 일어난다. 들쭉날쭉한 성능의 경계선도 여전히 존재한다. 예를 들어, AI는 여전히 독특한 문체로 글을 쓴다(실제로 Fable이 만드는 소프트웨어에도 Claude 특유의 흔적이 남아 있고, 진행 보고서도 마찬가지다. 그 무게를 짊어지고 답을 향해 나아간다는 느낌의 표현들이 곳곳에 등장한다). 하지만 더 근본적인 낯설음은 내가 한 일이 얼마나 적었는지, 그리고 작업이 이루어지는 동안 내가 얼마나 볼 수 없었는지에 있다.
작년에 나는 이 경험을 마법사와 함께 일하는 것에 비유했다. 주문을 외우면 무언가가 일어나는 것처럼. 하지만 Fable과 함께라면, 그 주문이 이제 너무 강력해진 나머지 내가 마법사인지조차 확신할 수 없다. 나는 마법사가 아니라 후원자에 가깝다. 원하는 것을 설명하고, 비용을 지불하고, 결과를 판단한다. 마법이 일어나는 과정은 내가 들여다볼 수 없는 어딘가에서, 내가 결코 참여하지 못한 수백 가지 작은 선택들 속에서 펼쳐진다. 일의 중심이 과정에서 결과로 옮겨갔다. 나는 더 이상 조종하지 않는다. 의뢰할 뿐이다.
어쩌면 이런 소외는 일시적인 현상일 수도 있다. 인터페이스가 아직 모델의 발전 속도를 따라잡지 못한 탓에 생긴 과도기적 상황이고, 머지않아 모델이 무엇을 하고 있는지 더 잘 들여다볼 수 있게 되고 중간에 개입하는 방법도 나아질지 모른다. 반대로, 모델이 강력해질수록 인간이 의미 있게 할 수 있는 일은 줄어들고 블랙박스는 그 능력의 대가라는 것이 진실일 수도 있다. 나는 후자가 실제로 진행될 방향일 가능성이 높다고 생각한다. 이것이 명백한 의미에서 통제력 상실은 아니다. 여전히 Fable을 조종할 수 있고, 지시를 놀라울 정도로 잘 따른다. 오히려 지시가 야심 찰수록 결과가 더 좋아진다. 하지만 조종하는 것은 더 이상 직접 하는 것과 같지 않다. 나는 모델에게 방향을 제시하고, 모델은 스스로 에이전트들을 실행해 조사하고 작성하고 서로의 작업을 검토하게 한다. 그리고 돌아오는 것은 완성된 결과물이다. 후원자는 한 명의 예술가에게 작업을 의뢰한다. 하지만 Fable은 하나의 스튜디오 전체에 가깝다. 나는 작업 현장에 한 번도 발을 들이지 않고 최종 결과물에 서명하는 클라이언트일 뿐이다.