로컬 모델로 서브 에이전트와 다중 에이전트를 어떻게 사용하시나요? 몇 개나 돌리시나요?
How do you use subagents & multiple agent with local models, and how many?
핵심 요약
로컬 모델 환경에서 다중 에이전트 운영 시 메모리 관리와 효율적인 작업 분배 방식에 대한 논의입니다.
- 메모리 관리 — vLLM 등을 활용해 KV 캐시를 최적화하면 더 많은 동시 세션 운영이 가능함
- 작업 효율성 — 에이전트를 상시 유지하기보다 작업 단위로 실행하고 종료하는 방식이 안정적임
- 모델 전략 — 복잡한 계획은 고성능 모델이, 단순 반복 작업은 소형 모델이 담당하는 것이 효율적임
- 오케스트레이션 — 구현 전 계획 단계에서 병렬화 전략을 미리 수립하는 것이 성능 향상에 도움됨
vllm에서 qwen3.8 27b nvfp4를 최대 컨텍스트로 돌려봤자 32k 컨텍스트씩 해서 에이전트 8개 정도밖에 안 돌아가네. 이거 너무 적은 거 아니냐? 다들 멀티 에이전트 프레임워크를 도대체 어디에 써먹길래 다들 좋다고 난리인 거임?


