24GB VRAM으로 로컬 멀티 에이전트 돌리기, 가능할까?
Doing local multi-agents with 24GB VRAM, Feasible?
핵심 요약
24GB VRAM 환경에서 로컬 멀티 에이전트 구현 가능성과 세션 분리 전략에 대한 질문입니다.
- VRAM 제약 — 24GB 환경에서 로컬 멀티 에이전트 운영의 현실성 논의
- 세션 분리 — 메인 컨텍스트 유지를 위한 세션 생성 및 정보 전달 방식 탐색
- 모델 추천 — 9b 양자화 모델이나 소형 모델과 외부 모델 조합 제안
내 설정은 90k ctx로 돌아가는데, 새 세션을 만들어서 메인 세션 ctx를 보존하는 더 좋은 방법이 있을지 고민 중이야. 온라인/레포 검색을 돌리고 필요한 정보만 메인 세션으로 가져오는 방식 말이야.
모든 걸 로컬에서 해결하고 싶고, VRAM 문제 때문에 모델 두 개를 동시에 돌리는 건 불가능해.
세션 스폰 방식이 가능할까? 어떻게 설정해야 하는지 알려줄 사람?


