AI 에이전트가 코드를 작성한다면, 고객이 버그를 겪을 때 누가 디버깅을 할까?
AI agents write the code. Who debugs it when a customer hits a bug?
핵심 요약
AI 에이전트의 디버깅 자동화 가능성과 그 한계인 '컨텍스트 부족' 문제에 대한 논의입니다.
- 디버깅의 어려움 — 코드 생성보다 과거의 사용자 행동과 맥락을 파악하는 것이 훨씬 더 복잡함
- 컨텍스트의 중요성 — 단순 로그보다 사용자 세션 데이터와 의사결정 과정 기록이 버그 해결에 핵심적임
- 자동화의 범위 — 에이전트는 읽기 전용 및 PR 생성까지만 수행하고, 배포는 사람이 직접 결정해야 함
- 신뢰성 확보 — 버그 재현 테스트를 통해 에이전트가 제시한 원인이 정확한지 검증하는 과정이 필수적임
지금 에이전트 관련해서 나오는 핫한 얘기들은 죄다 코드 짜는 거뿐임. 코파일럿이니, 코딩 에이전트니, 앱 빌더니 하는 것들 말이야.
근데 코드를 빨리 뽑아내면 그만큼 빨리 터지기도 하거든? 근데 정작 배포 이후에 벌어지는 일들은 아무도 신경 안 쓰는 거 같음:
-
고객이 버그를 겪어도 절대 말 안 해줌. 그냥 한 번 다시 시도해보고 바로 떠나버림.
-
에러가 깔끔하게 안 뜨니까 알림조차 안 옴.
-
결국 누군가는 로그 뒤지고, DB 쿼리 날리고, 사용자가 뭘 눌렀는지 추측해야 함. 나도 예전에 결제 버그 잡겠다고 몇 시간 동안 생쇼를 했는데 결국 못 찾았음.
그러니까 지금 이 루프가 완전히 불균형 상태임. 코딩은 자동화되는데, 정작 실제 사용자한테 왜 버그가 터졌는지 알아내는 건 여전히 수작업이니까.
다들 어떻게 생각하는지 궁금함:
-
코드 짜는 거 말고, 디버깅이나 장애 대응에 에이전트 쓰는 사람 있음? 뭐를 잘함?
-
어디서 막힘? 컨텍스트 부족? 원인 파악 실패? 아니면 그냥 못 믿겠음?
-
에이전트한테 어디까지 맡길 수 있음? 읽기 전용? PR 생성? 아니면 수정하고 배포까지?
-
디버깅이 코드 생성보다 에이전트한테 더 어려운 문제임, 아니면 그냥 인기가 없는 거임?
내 생각엔 디버깅 에이전트의 걸림돌은 모델 성능이 아니라 컨텍스트임. 버그는 레포지토리에 있는 게 아니라, 특정 고객이 뭘 했느냐에 달려 있거든.
그래서 난 고객 세션부터 시작해서, 당시 배포된 버전의 코드를 읽고, 문제 라인을 찾아서 PR까지 날려주는 AI 디버그 에이전트를 만들고 있음.
컨텍스트 부족이 진짜 문제라고 봄? 아니면 다른 이유가 있는 거임?

