LLM API를 프로덕션 환경에서 호출할 때 가장 자주 발생하는 문제는 무엇인가요?
What breaks the most when you call LLM APIs in production?
핵심 요약
프로덕션 환경에서 LLM API 호출 시 발생하는 주요 오류와 대응 방안에 대한 질문입니다.
- 주요 오류 유형 — 속도 제한, 형식 불일치, 응답 오류, 컨텍스트 초과, 모델 폐기 등이 빈번함
- 침묵의 실패 — 형식은 정상이지만 답변이 틀린 경우로, 검증 없이는 약 15% 발생함
- 대응 전략 — 재시도 로직에 의존하거나 자동 복구 시스템을 구축함
- 라우팅 솔루션 — Manifest와 같은 오픈소스 도구를 통해 모델 간 라우팅 및 폴백을 처리함
프로덕션 환경에서 LLM API를 호출하는 분들께 묻습니다. 가장 골치 아프게 만드는 오류는 무엇인가요?
제가 보기엔 다음 5가지가 계속해서 나타납니다:
- Rate limits / provider down. 리소스가 고갈된 경우입니다. 프로덕션 LLM 오류의 약 60%가 속도 제한(Datadog 기준)입니다.
- 공급자 간의 형식 불일치. max_completion_tokens여야 할 자리에 max_tokens가 오거나, additionalProperties가 거부되는 경우입니다. 3개 이상의 공급자를 다룰 때 상황은 더 악화됩니다.
- 잘못된 응답. 다시 전달되어야 할 'Thinking mode' 콘텐츠나 깨진 JSON이 포함된 경우입니다.
- 컨텍스트 초과. 요청이 너무 커서 잘리거나 거부됩니다.
- 모델 폐기. 자고 일어났더니 사용하던 모델이 사라진 경우입니다.
또 다른 문제는 '침묵의 실패(silent failures)'입니다. 응답은 정상으로 보이고 형식도 유효하지만, 답변 자체가 틀린 경우입니다. 활성 검증이 없는 경우 응답의 약 15%가 이런 식입니다(Rahul Suresh Babu의 Arxiv 논문).
여러분도 이런 문제를 겪으시나요? 어떤 게 가장 치명적인가요? 이를 처리하기 위해 무언가를 직접 만드셨나요, 아니면 그냥 재시도하고 잘 되길 바라는 수준인가요?


