재귀적 로컬 에이전트를 사용해 64k 컨텍스트를 300k 이상처럼 활용해본 사람 있음?
Has anyone actually made 64k feel like 300k+ with recursive local agents?
핵심 요약
로컬 모델에서 재귀적 에이전트 구조를 통해 컨텍스트 한계를 극복하려는 시도와 관련 도구에 대한 논의.
- 재귀적 에이전트 — 메인 에이전트가 하위 작업을 분할하여 컨텍스트를 효율적으로 관리함
- 도구 추천 — Prime Agent, GenericAgent 등 재귀적 작업 처리를 위한 프로젝트 언급
- 성능 논쟁 — Qwen 3.8 27B 모델의 64k 컨텍스트 활용 능력에 대한 회의적 시각 존재
- 구현 방식 — 복잡한 하네스 없이 파이썬으로 직접 구현하거나 MCP를 활용하는 방식 공유
지금 Qwen 3.8 27B를 GPU 하나에 올려서 로컬로 돌리는 중임. 컨텍스트를 131k까지 밀어붙일 순 있는데, 에이전트가 컨텍스트 관리만 잘해주면 64k로 좀 더 빠르게 돌리고 싶거든.
내가 생각하는 구조는 꽤 단순함:
-
모델 하나를 계속 상주시켜 둠
-
메인 에이전트한테 64k 할당
-
작업이 너무 커지면, 딱 필요한 작업이랑 컨텍스트만 들고 있는 자식 프로세스를 새로 생성함
-
만약 자식한테 100k짜리 문서를 던져주면, 다시 작업을 쪼개거나 자기만의 자식을 또 생성함
-
자식들은 한꺼번에 5개씩 돌리는 게 아니라 순차적으로 실행
-
전체 과정(trajectory)을 다 가져오는 게 아니라 결과물이나 아티팩트만 부모한테 반환
그러니까 300k짜리 작업이 들어와도 메인 에이전트는 64k를 넘기지 않으면서, 20k~50k짜리 가지치기 작업 여러 개로 처리되는 방식이지.
Prime Agent랑 그 RLM 설정이 내가 말한 거랑 제일 비슷해 보임. Hermes delegation도 관련 있어 보이고. 내가 아직 못 찾은 더 좋은 프로젝트가 있을지도 모르겠네.
혹시 여기 코딩, 리서치, 대형 문서 작업이나 일반적인 어시스턴트 업무를 위해 로컬 모델을 이런 식으로 돌려본 사람 있음?
궁금한 건 딱 세 가지임:
-
지금 당장 커스텀으로 이것저것 뜯어고칠 필요 없이, 이런 구조를 제일 잘 지원하는 프레임워크가 뭐임?
-
재귀적 분해(recursive decomposition)가 자동으로 잘 돌아간다고 믿을 수 있음? 자식이 자기 입력값이 너무 크다는 걸 스스로 판단해서 쪼개는 것까지 포함해서 말이야.
-
실제로 작업을 잘게 쪼갤 수 있다는 가정하에, 64k로 잘 관리된 에이전트가 네이티브 256k/1M 컨텍스트를 쓰는 거랑 성능 차이가 얼마나 남?
순수 RAG는 별로 관심 없음. 그냥 빠른 로컬 모델 하나로 유용한 작업 범위를 최대한 넓히고 싶은 거임.

