예산 내에서 AI 에이전트 인프라를 확장하는 방법은?
how do you scale infrastructure for ai agents on a budget?
핵심 요약
GPU 추론 부하에 맞는 효율적인 오토스케일링과 인프라 최적화 전략을 고민 중입니다.
- Triton Inference Server — 동적 배치 처리로 GPU 효율을 극대화하고 개별 요청 오버헤드를 줄임.
- 스트리밍 수집 계층 — 대용량 파일 처리 시 메타데이터를 먼저 파싱해 사용자 응답성을 높임.
- KEDA 오토스케일링 — 큐 깊이와 GPU 시작 시간을 기준으로 노드를 유연하게 확장함.
- 작업 분리 — 파일 수집과 에이전트 추론을 비동기로 분리해 I/O 병목을 방지함.
우리는 멀티모달 파일 처리(대용량 파일, 요청당 수백 MB)를 수행하는 에이전트 파이프라인을 운영 중이야. 에이전트 로직 자체는 잘 돌아가는데, 인프라가 문제네.
피크 타임에는 큐가 금방 밀려버려. 그렇다고 피크 용량에 맞춰 24시간 내내 프로비저닝을 유지하면 비수기에 비용이 너무 많이 들어. 일반적인 CPU/메모리 기반 오토스케일링은 여기서 잘못된 신호야. GPU 추론 작업 시 GPU 사용량은 일반적인 컴퓨팅 자원처럼 작동하지 않거든. 큐는 밀리고 있는데 기존 메트릭상으로는 노드가 여유 있어 보일 수 있어.
다들 이런 상황을 어떻게 해결하고 있어?
