구조화된 워크플로우와 소형 로컬 모델의 힘
The power of structured workflows and small local models
핵심 요약
소형 로컬 모델을 활용한 에이전트 루프 구축으로 Claude Code를 99% 대체한 경험 공유.
- 에이전트 루프 구축 — 직접 만든 에이전트 루프가 Claude Code를 99% 대체할 정도로 강력한 성능을 발휘함.
- 컨텍스트 관리 — Qwen3.5 9B 모델의 한계를 극복하기 위해 Map-Reduce 패턴으로 작업을 분할하여 처리함.
- 구조화된 출력 — LLM의 변동성을 줄이고 워크플로우의 안정성을 높이기 위해 구조화된 출력을 강제함.
- 워크플로우 모니터링 — 데이터베이스를 도입하여 에이전트의 작업 과정을 추적하고 효율적으로 관리함.
한 달 전, 저는 몇 가지 도구를 갖춘 아주 기본적인 홈메이드 에이전트 루프를 실험해 보았고, 그 조잡함에도 불구하고 놀라울 정도로 잘 작동한다는 것을 발견했습니다:
그 후, 에이전트 루프가 스스로를 수정할 수 있는 지점에 도달했을 때, 자신만의 에이전트 루프를 개발하는 것이 얼마나 중독적인지에 대해 글을 썼습니다:
https://www.reddit.com/r/LocalLLaMA/comments/1sq7cie/warning_do_not_write_your_own_ai_agent_if_you/
글쎄요, 28일이 지난 지금, 상황은 걷잡을 수 없이 커졌습니다. 너무 중독적이라 새벽 5시까지 작업하곤 했습니다.
좋은 에이전트 환경을 갖추고 나면, 인간인 당신이 가장 큰 병목 현상이라는 것을 금방 깨닫게 됩니다. 당신에게는 엄청난 할 일 목록이 있지만, 에이전트는 당신의 승인과 검토를 기다리며 유휴 상태로 앉아 있습니다.
뿐만 아니라, 저는 Qwen3.5 9B 모델을 사용하고 있기 때문에 모델의 지능과 컨텍스트에 제한이 있습니다. 수백 개의 데이터 파일을 한꺼번에 던져서 처리하라고 기대할 수는 없죠. 그래서 컨텍스트 제한 내에서 GPU의 FLOP을 최대한 활용하기 위해 작업을 더 작은 단위로 나누어 병렬로 실행하는 Map-Reduce 패턴을 통해 컨텍스트 제한을 관리하기로 했습니다.
구조화된 출력을 강제하는 것 또한 LLM의 변동성을 줄이고 원활한 Reduce 단계를 만드는 데 도움이 됩니다.
마지막으로, 워크플로우를 모니터링하고 추적할 데이터베이스를 갖추는 것이 유용합니다. 오늘 이를 구축하여 실행하는 데 성공했고, 소형 로컬 모델이 이 작업을 처리할 수 있다는 점에 만족합니다.
제 커스텀 에이전트는 이제 99%의 작업에서 Claude Code를 대체했습니다.

