Codemode가 설계된 테스트에서 40%의 토큰을 절약했지만, 난 그냥 껐다.
Codemode won its designed-for test by 40% (Token Savings). I still turned it off.
핵심 요약
Codemode가 특정 상황에서 토큰 절감 효과는 있지만, 실제 워크플로우에서는 비효율적이고 모델을 혼란스럽게 하여 사용하지 않기로 함.
- Codemode 성능 — 특정 테스트에서는 토큰 40% 절감 효과를 보임
- 실제 효용성 — 대부분의 워크플로우에서 거의 사용되지 않으며 비효율적임
- 모델 혼란 — 새로운 도구 추가로 인해 모델이 도구 선택에 혼선을 빚음
- 대안적 접근 — 필요할 때만 도구를 로드하는 방식이 더 효과적임
Codemode: 에이전트가 다른 도구들을 루프 돌리는 스크립트를 짜는 방식임. 결과물은 스크립트 안에 박아두고, 최종 답변만 뱉어내는 식이지.
두 번 테스트했고, 96번 돌렸는데 모델은 동일함. 96번 전부 다 맞혔음.
1라운드 테스트 - 간단한 수정. +21%.
작은 저장소에 한 줄짜리 버그 6개 심어둠. Codemode 도구 설명이 토큰 3천 개 정도 먹는데, 이게 메시지마다 계속 따라붙음. 간단한 수정은 어차피 호출 5번 내외로 끝나는데, Codemode가 발동도 안 되면서 토큰만 낭비함 (실행당 토큰 21% 더 씀).
2라운드 테스트 - 도구를 통한 60번의 대량 조회. −40%.
데이터를 도구로만 조회할 수 있게 설정해둠. 그레핑(grep) 같은 건 못 하게 막았음.
일반 에이전트: 왕복 60번 이상, 대량 결과값이 전부 컨텍스트에 쌓임.
Codemode: 스크립트 하나, 답변 하나. 토큰 40% 절감, 비용 절반, 왕복 7번 vs 64번. 이 작업량에선 확실히 압승임.
내 워크플로우에 맞나? 아니.
내 컴퓨터에 있는 세션 전부 훑어봄. 채팅 149개, 도구 결과값 16,735개. Codemode가 딱 맞는 상황은 딱 한 번 있었음. 진짜 용량 큰 결과값 168개는 이미 우리 가드(guard)가 디스크에 저장해둔 상태였고.
대신 내가 쓰는 방식
자주 안 쓰는 도구들(이미지 생성, 디자인 샌드박스, 지도, 브라우저)은 애초에 목록에 안 띄움. 에이전트가 작은 조회 도구로 한 번 검색하기 전까진 토큰 0임. 무거운 도구들은 내가 필요할 때만 불러옴 (예: Deep research).
결론: Codemode 쓸지 말지 에이전트한테 맡기는 거 딱 질색임. 내 워크플로우를 봐도 Codemode로 이득 볼 상황이 거의 안 나옴. 당분간은 Codemode 쓸 일 없을 듯.

