새 모델 나올 때마다 테스트만 하고 정작 기존 셋업은 안 바꾸는 루프에 빠진 사람 또 있나?
realized i heavily test every new model that drops but never actually switch from my current setup. anyone else stuck in this loop?
핵심 요약
새 모델을 단순히 데모용으로 쓰지 말고 실제 프로젝트에 적용해봐야 루프에서 벗어날 수 있음.
- 테스트 루프 — 새 모델이 나오면 3시간 정도 테스트만 하고 다시 원래 쓰던 도구로 돌아가는 습관.
- 컨텍스트 손실 — ChatGPT는 긴 세션에서 이전 결정을 잊어버리고 모순된 답변을 내놓는 경우가 많음.
- 실전 테스트 — 단순히 '뱀 게임' 만들기 같은 데모가 아니라 실제 복잡한 프로젝트로 모델 성능을 비교해야 함.
- GLM-5 활용 — 긴 컨텍스트 유지와 세션 중 자체 디버깅 기능 덕분에 긴 빌드 작업에 효과적임.
새 모델이 나올 때마다 3시간 정도 이것저것 테스트해보고 "와, 꽤 괜찮네"라고 생각한 뒤, 결국 원래 쓰던 걸로 바로 돌아가곤 함.
근데 최근에 제대로 비교를 해보기로 마음먹었음. 그냥 느낌적인 느낌이 아니라, 똑같은 프로젝트를 여러 모델로 돌려본 거임. 멀티 서비스 백엔드인데, 대단한 건 아니지만 어디서 문제가 터지는지 확인하기엔 충분히 복잡한 프로젝트였음.
ChatGPT는 여전히 매일 아침 가장 먼저 켜는 도구임. 빠르고, 설명 잘해주고, 문제를 빠르게 고민하거나 프로토타입 만들 때 최고임. 그건 변함없음.
바뀐 건 긴 빌드 세션에는 더 이상 안 쓴다는 점임. 모델이 나빠서가 아니라, 대화 초반에 내린 결정들을 계속 까먹는 패턴 때문임. 파일 6개쯤 건드리다 보면 2번째 파일에서 했던 말을 까먹고 딴소리를 함. 작은 거면 어떻게든 하겠는데, 큰 프로젝트에선 치명적임.
몇 개 써보다가 GLM-5가 내 워크플로우의 그 부분을 대체하게 됐음. 여러 파일에 걸쳐 긴 컨텍스트를 유지하고, 세션 도중에 스스로 디버깅하는 기능은 진짜 내가 필요한 줄도 몰랐던 기능임. 내가 말도 안 했는데 두 서비스 간의 의존성 충돌을 잡아내는 걸 보고 놀랐음.
내 요점은 "테스트만 하고 잊어버리는" 루프를 깨려면, 그냥 데모 작업이 아니라 진짜 업무를 맡겨봐야 한다는 거임. 만약 똑같은 루프에 빠져 있다면, 그냥 "뱀 게임 짜줘" 같은 거 말고 진짜 본인한테 중요한 작업으로 테스트해보길 바람.


