우리는 코딩 에이전트를 '느낌'으로 고르는데, 결과가 딱 그 수준이네
We pick coding agents by vibes, and it shows
핵심 요약
코딩 에이전트 선택 기준이 데이터가 아닌 주관적인 느낌에 의존하고 있어 발생하는 비효율성을 지적하는 글입니다.
- 에이전트 선택 기준 — 데이터나 로그 없이 그때그때의 느낌으로 Claude Code와 Codex를 선택함
- 모델의 가변성 — 동일 모델이라도 설정과 세션에 따라 성능이 달라져 객관적 평가가 어려움
- 기록의 부재 — 코드 커밋이나 결제 기록은 남기면서 정작 에이전트 행동은 기억과 느낌에만 의존함
- 데이터 기반 검증 — 실제 로그를 분석해보니 느낌으로 고른 선택이 데이터와 일치할 확률은 60%에 불과함
현재 우리는 Claude Code와 Codex, 두 가지 코딩 에이전트를 사용 중인데, 누군가 어떤 작업을 할 때 뭘 써야 하냐고 물어보면 솔직한 대답은 항상 "지난번에 느낌이 좋았던 거"입니다. 기록도, 지표도, 로그도 없고 그냥 (좋은?) 느낌뿐이죠.
문제는 같은 모델이라도 설정, 코드베이스, 그리고 현재 세션에 따라 다르게 작동한다는 겁니다. 그래서 "지난번에 느낌이 좋았다"는 말은 모델에 대한 평가조차 아닙니다. 그건 아무도 기록하지 않은, 특정 작업에서 특정 인스턴스가 보여준 일회성 경험일 뿐이죠.
우리는 코드 커밋 기록과 결제 로그는 남기면서, 에이전트의 행동에 대해서는 기억과 느낌만 남기고 있습니다.
여러분 팀은 어떤 종류의 작업에 어떤 에이전트를 신뢰할지 어떻게 결정하시나요?

