Sol은 변호사처럼 글을 쓰고, Fable은 변호사처럼 청구서를 보낸다: 200달러 구독료를 낸 두 서비스의 일주일 사용기
Sol writes like a lawyer, but Fable bills like one: a week on both $200 subscriptions, with receipts
핵심 요약
Claude와 OpenAI 모델을 각각 아키텍트와 코더로 활용한 일주일간의 비교 실험 결과, Claude의 높은 비용 효율성과 사용량 제한 문제를 지적함.
- 역할 분담 — Fable을 아키텍트로, Codex를 코더로 활용하여 프로젝트 진행함
- 비용 효율성 — 동일한 200달러 구독료 대비 OpenAI가 훨씬 더 많은 작업량을 처리함
- 사용량 제한 — Anthropic의 엄격한 사용량 제한으로 인해 실질적인 활용에 제약이 큼
- 모델 특성 — Claude는 인간적인 글쓰기에 강점이 있으나 비용 대비 효율은 낮음
Claude 팬들이 낫 들고 쫓아오기 전에 미리 말하는데, 나 Fable 좋아함. 솔직히 내 생각엔 지금 시장에서 사람처럼 글 쓰는 모델은 Fable이랑 Opus밖에 없음. Sol은 평소에 대화할 땐 사람처럼 잘 말하는데, 글 좀 써달라고 하면 갑자기 변호사로 돌변함. 그것도 박사급 변호사가 아니라, 이제 막 소제목 쓰는 법 배운 석사급 변호사처럼 굴어. "좀 쉽게 써봐"라고 하면 살짝 더 싼 변호사가 되고. 소제목은 여전히 똑같고 말이지 :) 근데 Anthropic 가격 책정 부서는 진짜 한 번 짚고 넘어가야 함. 얘네는 토큰 하나하나를 수도승들이 직접 손으로 그린 것처럼 가격을 매기는 게 분명함.
어쨌든, 지난주에 200달러짜리 구독 두 개를 개인 프로젝트 하나에 다 쏟아부었음. 아직 공개할 단계는 아닌 작은 평가 툴인데, 스포일러는 안 할 거임. 우리 팀은 나 포함 4명이었음. Claude Max의 Fable 5, Sol 5.6 Ultra의 Codex, 그리고 채팅용 Sol 5.6 Pro. 역할 분담은 자연스럽게 됐음. Fable은 설계자였음. 거대한 Claude Code 스레드 하나 잡고, 계획 짜고, 문서 관리하고, 사람 언어로 된 건 거의 다 처리했지. Codex는 빌더였는데, 와 진짜 빚쟁이한테 쫓기는 사람처럼 코드를 짜대더라. 깃(git)에 +9,000, -64 찍히는 날도 있었음. 화면 전체가 초록색이었지. Sol Pro는 의심 많은 검토자였는데, 다 끝난 것 같은 결과물 가져오면 왜 안 되는지 설명하는 게 유일한 일이었음. 그리고 난 유일한 인간으로서, 아주 똑똑한 기계 세 놈 사이에서 "아니, 그렇게 말고"라고 말하는 역할이었고. 두 스레드 다 같은 날 시작해서 같은 금요일에 주간 제한이 풀렸는데, 뭐랄까... 실험하다 터진 연구실 사고 같은 느낌이었음 :)
이제 재밌는 부분임. 금요일 오후 1시, Claude 제한이 풀렸는데 Fable은 90% 넘게 썼고 계정 전체는 60%를 넘겼음. Fable은 그냥 생각하고 문서만 썼는데도 이 모양임. 코딩도 안 했는데. OpenAI는 밤 10시 36분에 리셋됐는데, Codex가 일주일 내내 코드를 아침 점심 저녁으로 씹어 먹었는데도 23% 정도 남았더라. 솔직히 Opus를 메인 코더로 써보고 싶었음. 근데 계정 벌써 60% 넘은 거 보고 계산기 두드려보니까, Opus로 코딩 좀 빡세게 하면 수요일쯤에 내 200달러가 호박으로 변하겠더라고. 그래서 Fable은 설계자로 남고 난 겁쟁이로 남았지 :) Anthropic 구독은 토큰을 사는 게 아님. 작은 연료 게이지랑 가벼운 불안 장애를 사는 거지. 그리고 그 막대기가 줄어드는 걸 매의 눈으로 지켜보는 거고.
나중에 리셋부터 리셋까지의 로컬 로그를 싹 다 뽑아봤음. 내가 원래 좀 그런 성격이라. Codex는 토큰 약 27억 개를 처리했고, Claude 스레드는 6억 6,300만 개 정도였음. 다들 기절하기 전에 말하는데, 둘 다 96~98%는 캐시된 컨텍스트를 계속 다시 읽은 거임. 아주 비싼 금붕어 두 마리가 자기 일기장 계속 다시 읽는 꼴이지 :) 순수 입력이랑 출력만 따지면 63.6M 대 24.6M인데, 수치보다 모양이 더 웃김. Codex가 호출을 11배 더 많이 했는데, Fable은 한 번 턴을 돌 때마다 4배는 더 무겁게 움직였음. 하나는 잔잔하게 붓질하고, 다른 하나는 대리석 판을 내리꽂는 느낌. 실험용 호출 1,600번 정도는 구독료 외에 추가 비용이 안 들었고, 페이로드(payload)는 Codex 순수 토큰의 1% 정도였음(이건 최소치고, 숨겨진 추론은 포함 안 됨). 그냥 관찰 결과니까 벤치마크라고 태클 걸지 마셈.
일주일 내내 느낌이 왔음. Fable이 설계하고 Sol이 검토할 땐, Sol이 중요한 것 중 3분의 2 정도를 잡아냈음. 반대로 하면 3분의 1 정도고. 구독료는 둘 다 똑같이 200달러고 리셋 날짜도 같으니까... Claude 스레드 전체를 새 Sol Pro 채팅에 넣고 양쪽 수정 사항을 세보라고 시켰음. 규칙은 엄격하게: 칭찬 금지, 스타일 관련 금지, 반복 금지, 거절된 아이디어 금지. 나중에 수용되거나 구현되거나, 다른 감사에서 확인된 수정 사항만 카운트했음.
| OpenAI ($200) | Claude ($200) | |
|---|---|---|
| Accepted correction score (severity-weighted) | 178 | 111.5 |
| Share of serious findings |


