AI 파이프라인을 무인으로 돌린다면, 고장 나기 전에 미리 사소한 것까지 기록해 두세요
If your AI pipeline is running unattended, log the boring stuff now, not after it breaks
핵심 요약
AI 파이프라인 운영 시 사소한 예외 처리와 결정 이유를 기록해 두어야 나중에 발생할 문제를 방지하고 디버깅 시간을 줄일 수 있습니다.
- 로그 기록 — 사소한 예외 처리와 결정 이유를 기록하여 나중에 발생할 문제를 예방함
- 데이터 검증 — 입력과 출력 행 수를 비교하여 데이터 누락을 조기에 발견함
- 구조화된 로그 — '무엇'뿐만 아니라 '왜'를 포함한 구조화된 로그를 작성함
- 변경 이력 — 예외 규칙 변경 시 타임스탬프를 남겨 설정 드리프트를 방지함
자동화된 AI 파이프라인을 만들고 있다면, 나중에 필요해지기 전에 지루한 것들부터 미리 기록해 둬라. 어떤 게 실행에서 제외됐고 그 이유는 뭔지, 버전 간에 뭐가 바뀌었는지, 뭐가 고장 났고 단순히 고쳤다는 사실뿐만 아니라 실제로 어떻게 해결했는지까지 말이다.
나중에 다 끝나고 나서 적으려면 절대 안 하게 된다. 그때 가서 분명 후회할 거다.
나도 내 거 만들다가 아주 짜증 나는 방식으로 이걸 깨달았다. 몇 주 동안은 잘 돌아가다가 갑자기 뭐가 뻑 났는데, 해결책은 내가 예전에 내렸던 결정 속에 있었거든. 근데 그걸 코드에도, 문서에도 안 적어놓고 그냥 머릿속에만 넣어뒀던 거다. 막상 그게 중요해졌을 땐 왜 그런 결정을 내렸는지 도저히 기억이 안 나더라.
이제는 사소한 예외 처리나 엣지 케이스도 마주칠 때마다 바로 기록한다. 아무리 하찮아 보여도 말이야. 뭐가 중요하고 뭐가 지루한지 판단하는 건, 미래의 나보다 과거의 내가 훨씬 더 못하더라고.
다들 AI 파이프라인 만들면서 "진작 기록해 둘걸" 하고 후회하는 것들, 기본적으로 어떤 걸 로그로 남기는지 궁금하다.


