Datadog 보고서: LLM 호출 오류의 60%는 속도 제한이며, 이제 용량 부족이 주요 장애 원인
Datadog says 60% of LLM call errors are rate limits, and capacity is now the dominant production failure mode
핵심 요약
LLM 서비스 장애의 주범은 환각이 아니라 속도 제한과 용량 부족임이 데이터로 증명됨.
- 주요 장애 원인 — LLM 서비스 오류의 대부분은 환각이 아닌 속도 제한과 용량 부족으로 발생함.
- 아키텍처 문제 — 멀티 에이전트와 ReAct 루프의 동시성 폭주가 조직 단위의 할당량을 빠르게 소진시킴.
- 컨텍스트 품질 — 단순히 많은 토큰을 사용하는 것보다 필요한 정보를 정확히 추출하는 능력이 더 중요해짐.
- 핵심 역량 변화 — 프롬프트 엔지니어링보다 용량 엔지니어링과 컨텍스트 엔지니어링이 실무에서 더 중요해짐.
Datadog에서 이번 주에 State of AI Engineering 보고서를 발표했어. 이 수치들을 보고 LLM 신뢰성에 대해 다시 생각하게 됐지.
2026년 2월: 전체 LLM 호출 스팬의 5%에서 오류가 보고됐어. 그중 60%가 속도 제한(rate limit)이었지.
2026년 3월: 스팬의 2%에서 오류가 반환됐지만, 여전히 속도 제한이 전체의 약 30%를 차지했어. 이건 한 달 동안 텔레메트리에서 840만 건의 속도 제한 실패가 발생했다는 뜻이야.
결론은 LLM 앱의 주요 프로덕션 장애 모드가 환각도, 나쁜 컨텍스트도, 불안정한 도구도 아니라는 거야. 바로 단순한 용량 고갈이지. 429나 529 오류 같은, 지난 20년간 전통적인 인프라 엔지니어들이 처리해온 지루한 종류의 장애 말이야.
상황을 더 악화시키는 건 대부분의 팀이 사용하는 아키텍처 패턴이야. 가변적인 ReAct 루프와 멀티 에이전트 협업은 예측 불가능한 버스트로 동시성 급증을 만들어내서 조직 단위의 공유 할당량을 소진시켜 버려. p50 처리량은 괜찮아 보이지만 p99는 절벽 아래로 떨어지는 거지.
보고서에서 계속 생각나는 또 다른 문구는 이거야: 컨텍스트 품질이 양보다 더 중요한 새로운 제한 요소라는 것. 대부분의 팀은 모델의 전체 컨텍스트 윈도우를 사용하는 것과는 거리가 멀어. 검색 파이프라인이 올바른 10K 토큰을 선택하지 못한다면 1M 토큰 기능은 낭비일 뿐이지.
용량 엔지니어링과 컨텍스트 엔지니어링은 2026년 프로덕션 LLM 시스템에서 성과를 내는 두 가지 핵심 기술로 조용히 자리 잡고 있어. 프롬프트 엔지니어링이라는 분야는 점점 이 기술들의 하위 개념이 되어가고 있지.


