가장 낮은 지연 시간(latency)을 가진 LLM API
Lowest latency LLM API
핵심 요약
장시간 실행되는 코딩 에이전트의 비용과 지연 시간을 줄이기 위한 최적화 전략을 논의함.
- 프롬프트 캐싱 — 시스템 프롬프트와 리포지토리 컨텍스트를 캐싱하여 비용과 지연 시간을 획기적으로 절감함.
- 계층적 모델 전략 — 단순 작업에는 소형 모델을, 계획 및 반영 단계에는 고성능 모델을 사용하는 계층적 접근 방식을 도입함.
- 인프라 최적화 — Groq이나 General Compute 같은 고속 추론 제공업체를 활용하여 응답 속도를 개선함.
- 사용자 경험 개선 — 12시간 이상 실행되는 에이전트보다는 빠른 시각적 피드백을 선호하는 사용자 니즈를 파악함.
Claude Code 같은 코딩 하네스를 만들고 있는데, 훨씬 더 길게 실행되는 장기적인 관점의 에이전트를 목표로 하고 있어. 현재 하루 종일 작동하게 만드는 데 성공했어. 랜딩 페이지, 마케팅 페이지, 가격 책정, 전체 제품 구현, 그리고 관찰/로깅까지 가능해.
이렇게 오래 실행되는 게 멋진 기능이라고 생각했는데, 초기 사용자들은 12시간 이상 돌아가면 흥미를 잃더라고. 게다가 모든 도구 호출 결과와 코드 컨텍스트를 매 프롬프트마다 다시 집어넣다 보니 토큰 비용이 급격하게 불어나. 현재는 작업 단계에는 소형 모델을 쓰고, 계획 및 반영 단계에만 비싼 모델을 쓰는 방식을 고려 중인데, 속도를 높이고 비용을 절감할 수 있는 다른 방법이 있다면 추천 부탁해.
혹시 좋은 계층적 접근 방식을 찾은 사람 있어?


