에이전트 코딩 도구들이 Anthropic의 가격 정책에 반발하며 대안을 모색하고 있다는 이야기가 요즘 여기저기서 나온다. Fable 출시 직후 몇 주간 머릿속을 맴돌던 생각이 다시 떠오른다. 공짜 점심은 끝났다.
무어의 법칙(Moore's Law)이 살아있던 시절에는 코드를 무자비하게 최적화할 이유가 없었다. 18개월만 기다리면 성능을 두 배로 끌어올릴 CPU가 나타날 테니까. Herb Sutter는 이를 "공짜 점심"이라고 불렀다 — 그의 기념비적인 글에서.
2000년대 중반 무어의 법칙이 둔화되면서(특히 단일 스레드 성능이 정체되기 시작하면서), 우리는 갑자기 병렬화, 아키텍처, 메모리 지역성 같은 문제들을 진지하게 고민해야 했다.
어떤 작업을 어디서 처리할지 따져봐야 했던 것이다.
Fable 이전에는 코딩 하네스나 컨텍스트 전략 개선에 너무 많은 시간을 쏟는 게 괜한 낭비처럼 느껴졌다. 새 모델이 같은 가격에(혹은 더 저렴하게!) 출시되어 대부분의 문제를 덮어버릴 테니까.
그런데 Fable이 등장했다. 당시에도, 지금도 정말 놀라운 모델이다. 하지만 비용이 너무 높았고, 우리가 필요한 대부분의 코딩 작업에는 Opus도(5.6도, K3도, 심지어 GLM도) 충분했다. 대부분의 경우에는.
그래서 우리는 어떤 작업을 어디서 처리할지 고민하기 시작했다.
GLM 5.2는 주목할 만한 모델이다. Fable과 같은 주에 출시됐는데, 비용은 약 1/9 수준이다(Opus 5 대비로는 약 1/5). 그렇다면 GLM은 Fable 품질의 1/9에 불과한가? 특정 유형의 작업에서는 그럴 수도 있다. 하지만 반복적인 코딩 작업 대부분에는 충분하고도 남는다. 특히 좋은 컨텍스트가 제공될 때는 더욱 그렇다. 나는 Fable과 대화하며 설계를 탐색하고 다듬은 뒤, 작업 지시서를 GLM에 넘기는 방식을 자주 사용한다.
추론 비용이 계속 내려가면 결국 모든 작업을 대형 모델에 맡기던 시절로 돌아갈 거라는 반론도 있다. 하지만 나는 그렇게 확신하지 않는다. 같은 가격 하락이 K3나 Qwen 같은 모델들에도 똑같이 적용될 것이고, 더 나은 하네스를 계속 개발해 나가다 보면 성능이 다소 낮더라도 충분히 뛰어난 모델에 적절한 컨텍스트를 제공해 좋은 결과를 내는 일이 점점 수월해질 테니까.
게다가 Fable이 가져온 또 다른 충격이 이 변화를 굳히게 될 가능성이 높다. Fable의 접근 제어, 동적 성능 저하 정책, 의무적인 데이터 보존 요건은 많은 기업들(그리고 국가들까지!)이 자신들의 트레이스를 어디로 보내고 어디서 토큰을 받아올지 진지하게 고민하게 만들었다.