모델 성능이 충분히 좋아지고 있다... 가격도 중요하겠지만, 결국 승패는 속도가 결정할 것
The models are approaching good enough.....price, for a bit will matter. But speed is going to take the win
핵심 요약
AI 모델이 '충분히 좋은' 수준에 도달하면서, 향후 경쟁의 핵심은 토큰 비용과 처리 속도가 될 것이라는 분석입니다.
- 모델 성능 상향 평준화 — 주요 모델들이 신뢰할 수 있는 수준에 도달하여 작업 효율이 극대화됨
- 경쟁의 핵심 요소 — 모델의 지능보다 토큰 비용과 처리 속도가 승패를 가르는 결정적 요인이 됨
- 컴퓨팅 자원 확보 — 장기적으로는 대규모 컴퓨팅 자원을 안정적으로 확보하는 기업이 시장을 주도할 것
- 비즈니스 활용 사례 — 트레이딩 소프트웨어 개발 및 대규모 교육 콘텐츠 생성 등 복잡한 작업에 AI가 적극 활용됨
난 20x 계정 3개를 돌리는 중이다. 클로드 2개, 그리고 코덱스 1개(페이블 제한 때문에 쓸모없어지고 오퍼스 5.0밖에 없던 시절에 대체 뭔 난리인가 싶어서 돌려본 거다). [코덱스 계정은 일단 갱신 안 할 생각이다].....
내 작업량은 엄청나다. 오케스트레이션 에이전트를 돌려놓고, 일주일 치 토큰이 충전되자마자 병렬로 작업을 조져버린다. 보통 1~2일이면 계정 한도를 다 써버리는데, 주중에 기능이나 콘텐츠 검토하면서 마무리할 거 생각해서 3~5% 정도는 남겨둔다. 오퍼스 5.5로 넘어오면서 사용 기간이 5일 중 2일 정도로 늘어났다. 확실히 엄청난 발전이다. 전부 같은 코드 베이스로 돌리고 있어서 성능 비교는 확실히 된다.
내가 느낀 점은 이거다.
- 전부 다 일은 제대로 해낸다. 이제 아스트라가 오케스트레이팅을 하든, 페이블이 하든, 아니면 지금처럼 오퍼스 5.5가 하든, 어떤 '시스템'을 쓰는지 따위는 신경도 안 쓴다. 세세한 거 신경 쓸 시간 있으면 결과물 검토하고 다음 단계 설계하는 게 훨씬 이득이다.
- 오퍼스 5.5가 확실히 더 빠르고, 스스로 수정하는 작업(re-work)도 덜 필요하다. 아스트라는 수정 작업이 좀 더 많은데, 한 15% 정도 더 들어간다. 지가 알아서 필요성을 파악하고 수정하긴 하지만, 그만큼 효율은 떨어진다.
- 챗GPT 모델들이랑 '대화'하는 건 여전히 훨씬 낫다. 오퍼스 5.5가 아무리 좋아도 챗 모델들이 뱉어내는 그 특유의 '블라블라'보다는 5배는 더 말이 많다.
- 이제 속도랑 효율이 핵심 차별점이다. 아스트라는 5시간 제한이 없는데도 토큰 사용량 관점에서 보면 훨씬 느리고 효율도 개판이다. 아마 솔 6.1이 나오면 좀 비슷해질지도 모르지.
- 이제 코드든 콘텐츠든 어떤 모델이 작업하는지는 아예 신경도 안 쓴다. 둘 다 엄청난 발전을 보여줄 테니까. 중요한 건 이제 내 신뢰 임계치를 넘었다는 거다.
- 클로드는 주간 토큰 예산으로 인간 작업량 기준 2000~2500시간 정도를 해치우고 있다. 모델한테 추정치를 물어보면 나오는 수치인데, 실제로 작업 처리하는 거 보면 얼추 맞는 것 같다. 휴일 없이(주 5일, 하루 8시간 이상) 1년 동안 할 일을 일주일 만에 끝내는 셈이다. 아스트라한테는 안 물어봤는데, 아마 그거보단 좀 덜하겠지... 그래도 한 발짝 물러서서 생각해보면, 와, 진짜 미쳤다.
AI 업계의 오래된 격언인 "지금이 AI 역사상 가장 구린 시점이다"라는 말이 귓가에 쟁쟁하게 울린다(이 메시지 내가 직접 썼다는 걸 보여주려고 dd를 두 번 썼다... 뭐, 이중 심리일 수도 있겠지만).
나한테 이 두 주요 모델 그룹은 이미 내가 원하는 건 다 해주고 있다. 토큰만 더 있으면 작업량을 10배로 늘릴 수도 있는데, 앞으로 누가 이길지는 결국 그 토큰 싸움이 될 거다. 장기 실행 작업 관리나 토큰당 지능 같은 문제들은 이제 '질문거리'도 안 되는 수준으로 빠르게 넘어가고 있다. '충분히 좋은' 수준에 도달하기 시작했거든.
이제 남은 건 뭐냐? 비용이랑 속도다. 지금보다 두 배 더 똑똑한 모델을 주든, 아니면 지금 성능 그대로인데 더 싸고 빠른 모델을 주든, 나라면 무조건 후자를 택할 거다. 내가 코덱스를 써본 이유도 그거고. 아스트라가 오퍼스 5.0보다 낫길래 써봤더니, 토큰 효율이 개판이라 문제였지.
내 생각엔 '충분히 좋은' 수준은 이제 수렴하기 시작했고, 결국 컴퓨팅 자원 접근성이 모든 걸 결정할 거다. 장기적으로 누가 가장 많은 컴퓨팅 자원을 확보하느냐? 아마 일론 머스크일 거고, 그록 모델들도 가속도가 붙고 있다. 중국 모델들은 이 판에서 어떻게 될까? - 잘 모르겠다. 한동안은 컴퓨팅 자원 제약에 시달리겠지만, '충분히 좋은' 임계치에 도달하는 건 시간문제다.
내 생각의 논리에서 유일하게 구멍이라고 보이는 건, '두 배(혹은 x배) 더 좋다'는 말이 지금 당장은 내가 상상도 못 할 정도로 판도를 뒤집어 놓을 무언가를 의미할 수도 있다는 점이야. 내 추측으로는, 연구소들이 컴퓨팅 자원을 돌려서 다음 모델을 학습시키거나 새 모델을 출시할 때 모델 성능이 너프되는 현상이 나타나는데, 이때 컴퓨팅 자원을 계속 확보해 두는 게 핵심일 것 같아. 결국 고객한테 필요한 수준의 컴퓨팅 자원을 꾸준히 유지하는 놈이 이기는 거지. 예를 들어, 어제 기준으로 Peak-Opus 5.5가 돌아가던 그 Opus 5.5 수준을 계속 유지하는 것처럼 말이야.

