가장 똑똑한 AI 모델 사용을 중단했다. 프로그래밍이 더 빠르고 저렴해졌다.
I stopped using the smartest AI models. Programming got faster and cheaper.
핵심 요약
비싼 최상위 AI 모델 대신 가성비 좋은 모델을 활용해 프로그래밍 효율과 비용을 최적화하는 전략을 공유합니다.
- 비용 효율성 — 작업당 비용을 기준으로 모델을 선택하면 훨씬 저렴하게 개발 가능함
- 속도 경쟁 — 에이전트 모드에서는 모델의 지능보다 생성 속도가 작업 효율에 더 큰 영향을 미침
- 컨텍스트 최적화 — 불필요한 정보로 컨텍스트를 낭비하는 대신 상태 유지형 모델이 필요함
- 개발 도구 변화 — 무거운 IDE 대신 가벼운 도구와 최소한의 도구 세트를 선호하는 추세임
휴가는 생각하고 탐색할 시간을 준다. 나도 이번에 몇 가지를 발견하고 깨달은 게 좀 있다. 프로그래머 입장에서 이제는 제일 똑똑하고 비싼 AI 모델이 딱히 필요 없다는 사실이다. 알고 보니 "작업당 비용(Cost per Task)"이라는 지표가 있는데, 이걸로 따지면 GPT-5.6 Luna (max)가 1등을 먹었다. 반면 Codex를 쓰면 리스트에서 제일 멍청한 모델이다. Artificial Analysis Intelligence Index가 고작 38밖에 안 되거든. 비교하자면 제일 똑똑한 GPT-6 Astra (max)는 53점이다. 결국 작업 하나 끝내는 데 Luna는 $0.18인데, Astra는 $3.26이나 든다. 거의 20배 차이다. 내가 이해하기로 "작업당 비용" 벤치마크는 이런 식이다. 모델한테 제대로 잘 짜인 평범한 과제를 던져주고, 그걸 완료하는 데 토큰이 얼마나 드는지 측정하는 거다. 그러니까 "대충 엉망인 걸 명세서로 바꿔줘" 같은 게 아니라, 이미 답의 절반은 포함하고 있는 잘 만들어진 질문을 던지는 거지.
처음엔 안 믿겨서 Luna 라인업 중 제일 멍청한 모델로 작업을 시작해 봤다. 근데 무슨 일이 일어났는지 아냐? 5시간 제한이나 주간 제한에 걸리는 일이 싹 사라졌다. 한 달에 20달러 내는 플랜인데 말이야! :) 나도 프로그래머지만, Codex는 나를 뺑뺑이 돌리지도 않고, 이미 5번이나 시킨 작업을 완료시키려고 굳이 더 똑똑한 모델로 갈아탈 필요도 없다. 비전공자 느낌 나는 코더들이 똑같이 하는 짓을 많이 봤는데, AI가 계속 헛소리하면 더 똑똑한 모델로 바꿔서 해결하려는 거다. 뭐, 실력 없는 프로그래머들한테는 그게 먹히겠지. 근데 실력 있는 프로그래머라면 그건 말이 안 된다. 완전히 게을러져서 뇌를 빼놓고 사는 게 아니라면 말이야.
지금 상황이 이렇다. 제일 싸고 멍청한 최신 모델들도 이제 충분히 똑똑해졌다. 자기 할 줄 아는 놈들한테는 이 정도 수준이면 차고 넘친다. 더 똑똑한 모델을 만들려는 경쟁은 이제 끝물인 것 같다. 근데 다른 문제가 하나 터졌다. 바로 속도다. DeepInfra나 OpenRouter에서 특히 심하다. 지금 괜찮은 모델들 생성 속도가 평균 초당 25~50 토큰 정도다. Luna조차도 Codex에서 작업 하나 끝내는 데 평균 5~15분은 걸린다. 에이전트 모드에서는 진짜 속 터지는 속도다. 슬슬 짜증 나기 시작한다. DeepSeek-V4.1-Flash를 DeepSeek API로 직접 쓰면 속도가 초당 300 토큰까지 나온다. 차이를 봐라. 작업 하나 끝내는 데 5분이 아니라 1분도 안 걸린다. 어려운 작업이라도 15분이 아니라 5분이면 끝난다. 프로그래머라면 작업을 시작했을 때 AI가 최대한 빨리 끝내주길 바라지 않겠냐. 5분에서 15분씩 기다리는 것보다 훨씬 쾌적하다. 심지어 DeepSeek-V4.1-Flash의 Artificial Analysis Intelligence Index는 40으로, Luna보다 2점이나 높다.
결국 에이전트 AI 개발의 다음 단계는 속도다. 지금은 중국 모델들이 이기고 있다. 근데 내가 듣기로는 미국 LLM 업체들도 우리한테 뭔가 깜짝 놀랄만한 걸 준비 중인 것 같다. Anthropic은 좀 헤매는 것 같지만, OpenAI는 조만간 초당 수천 토큰씩 찍어내는 데이터 센터를 가동할 모양이다. 상상해 봐라. 예전엔 작업 하나 던져놓고 몇 분씩 기다려야 했는데, 이제는 10~30초면 다 끝난다. 생각의 속도로 돌아가는 비즈니스지 :) 아이디어를 떠올리고 고민 좀 하다 보면, 결과물이 벌써 검토해달라고 대기 중인 거다 :)
더 큰 컨텍스트 윈도우를 차지하려고 벌였던 그 난리 기억나냐? "우린 65,000 토큰!", "우린 250,000!", "우린 50만!", "우린 100만 토큰 컨텍스트 윈도우다!" 솔직히 말해서, 이제 그 경쟁은 끝났다고 본다. 더 키워봤자 의미가 없어. 사실 AI 코딩 에이전트가 등장하게 된 것도 컨텍스트 윈도우가 커졌기 때문이거든. 에이전트가 작업을 수행하면서 컨텍스트를 계속 늘려나갔고, 20~30번 정도 사이클을 돌면서 50만이나 100만 토큰까지 도달해 뭔가 쓸만한 결과를 내놓는 식이었지. 근데 지금 가장 큰 문제는, AI 에이전트가 새로운 작업을 할 때마다 매번 처음부터 코드랑 저장소 규칙을 다시 공부해야 한다는 거야. 전체 작업량의 80%는 상황 파악하는 데 다 쓰고, 실제로 코드를 수정하는 건 고작 20%밖에 안 돼. 그 빌어먹을 100만 토큰짜리 컨텍스트 윈도우 때문에 매번 싹 다 초기화하고 다시 시작해야 하니까. 그래서 이제 다들 깨달은 거지. 결국 우리한테 필요한 건 일종의 '장기 기억'이라는 걸. 그게 있으면 컨텍스트 윈도우는 사실상 무한대가 되는 거니까.
그러니까 모델이 컨텍스트 윈도우 넘쳤다고 처음부터 다시 시작할 필요가 없어진다면, 코드베이스를 오래 다룰수록 프로젝트 구조를 더 깊이 이해하게 되겠지. 그래, 제발 상태 유지(stateful)되는 LLM 좀 내놔라. 상태 없는(stateless) LLM은 이제 지긋지긋해! 참고로 이미 몇몇 프로젝트에서 이 방향으로 개발 중이야. 시장은 이미 준비됐고, 컨텍스트 윈도우를 200만, 300만 토큰으로 늘리는 것보다 이게 다음 단계가 될 거라고 본다.


