5가지 인기 토큰 절약 방법을 10가지 실제 작업으로 테스트해 본 결과, 두 번의 실행 모두에서 토큰을 줄인 방법은 없었습니다.
I tested 5 popular token saving methods across 10 real tasks, and none cut total tokens in both runs.
핵심 요약
토큰 절약 기법들이 실제로는 토큰 사용량을 줄이기보다 에이전트의 행동 방식을 변화시켜 품질 저하나 비용 증가를 초래함을 입증했습니다.
- 토큰 절약 기법 — 6가지 방법을 테스트했으나 일관되게 토큰을 줄인 사례는 전무함
- 행동 변화 — 토큰 절약 시도가 에이전트의 검색, 검증, 코드 수정 방식에 영향을 줌
- 비용 효율성 — 5.6 Terra xhigh 모델로 교체하는 것이 유일하게 비용을 절감함
- 품질 저하 — 일부 기법은 코드의 견고성과 범위 설정에 부정적인 영향을 미침
TL;DR
- 내 저장소에 있는 10가지 실제 코딩 작업을 대상으로 5.6 Sol 모델에서 토큰 절약 기법 5가지(와 더 저렴한 모델 하나)를 비교해 봤다. 7가지 방식(6개 기법 + 기준 모델)을 각각 두 번씩, 총 140번의 에이전트 실행을 돌렸다.
- 6가지 기법 중 어느 것도 두 번의 실행 모두에서 전체 토큰을 줄이지 못했다. 평균적으로는 5개가 오히려 토큰을 더 썼다. Context Mode는 토큰이 68%나 늘어나서 최악이었다.
- 이 모드들이 확실하게 바꾼 건 에이전트의 행동 방식이었다. 검색, 위임, 검증, 패치 범위를 어떻게 다루는지가 달라졌다. 몇몇 기법은 토큰을 아끼려다 코드 리뷰 문제, 의도와 다른 패치, 유지보수성 저하라는 대가를 치렀다.
- 유일하게 확실한 비용 절감은 5.6 Terra xhigh로 바꾸는 거였다. 토큰은 조금 더 썼지만 달러 기준으로는 49%나 아꼈다.
- Codex 모델 기준이긴 하지만, Claude 쓰는 친구들한테도 충분히 적용 가능한 결과라고 본다 :)
토큰이랑 돈 아껴준다는 툴은 널리고 널렸다. "별다른 손해 없이 토큰을 줄여준다는데, 안 쓸 이유가 있나?" 싶지?
나도 이런 주장들이 진짜인지 직접 검증해보고 싶어서, 내 저장소에 있는 10가지 실제 작업(직접 만든 로컬 평가 도구 사용)을 가지고 6가지 방법을 테스트했다. 각 작업은 실제로 머지(merge)된 변경 사항들이다. 원래 저장소 상태에서 다시 실행해보고, 테스트 통과 여부, 의미적 동일성, 코드 리뷰, 풋프린트 위험도, 그리고 8가지 품질 지표로 점수를 매겼다.
기준(Baseline)은 5.6 Sol 모델에 보통 수준의 노력을 들인 경우다. 테스트한 6가지 방식은 다음과 같다.
- Caveman: 원시인처럼 행동하게 함.
- Ponytail: 에이전트를 세상에서 제일 게으른 시니어 엔지니어로 만듦. 출력 최소화, 코드 짜기 전에 YAGNI(당장 필요 없는 건 만들지 마라) 원칙 따지기, 검증 횟수 제한하기 등을 지시함.
- RTK: 셸 명령어 출력이 모델에 들어가기 전에 필터링하고 압축해주는 래퍼.
- Context Mode: 명령어를 배치로 처리하고, 큰 결과물은 인덱싱한 뒤 관련 있다고 판단되는 부분만 반환함.
- Mandarin: 중국어 텍스트가 밀도가 높아서 토큰을 아낄 수 있다는 가설을 검증하기 위해 프롬프트를 중국어로 번역함.
- Terra xhigh: 더 높은 추론 노력을 들이는 더 저렴한 모델.
모든 방식은 두 번씩 실행했다. 같은 작업을 반복해서 실행했으니 일관성을 측정할 수 있다. 같은 모델이라도 실행할 때마다 토큰 사용량은 달라지니까.
분석 내용과 데이터 시각화가 포함된 전체 글은 여기서 확인: https://www.stet.sh/blog/gpt-56-token-saving-modes
JetBrains 따라 하는 것처럼 보일 수도 있는데, 나도 이거 병렬로 작업하던 중이었고 그쪽 심층 분석 글도 읽어보는 걸 강력 추천한다. 링크는 본문에 걸어뒀다.
결과
아래 토큰 및 비용 열은 두 번의 실행 동안 각 모드의 변화를 기하 평균으로 나타낸 것이다. 마이너스 값은 절감을 의미한다.
| Mode | Total tokens | Cost |
|---|

