Agent OS를 밤새 켜뒀더니 내가 시키지도 않은 도구 4개를 스스로 만들었음
I left my Agent OS running overnight and it built 4 new tools I didn't even ask for
핵심 요약
AI 에이전트가 작업 중 필요하다고 판단하면 스스로 도구를 코딩하고 시스템에 등록하는 자율형 Agent OS 개발기.
- 자율 도구 생성 — 에이전트가 작업 중 필요하다고 판단하면 직접 스크립트를 작성하고 테스트하여 OS에 등록함.
- 컨텍스트 관리 — 벡터화된 메모리 계층을 사용하여 긴 세션에서도 에이전트의 지능 저하를 방지함.
- 다중 에이전트 합의 — 리뷰어와 코더 시스템을 통해 주요 변경 사항을 결정하고 때로는 불만을 제기하기도 함.
- 샌드박스 보안 — 도커 컨테이너와 WSL2를 활용해 에이전트가 호스트 환경을 건드리지 못하도록 격리함.
최근 자율 에이전트에 푹 빠져 있었는데, 에이전트가 적절한 "도구"가 없거나 한 시간만 지나도 컨텍스트 윈도우가 엉망이 되어버려서 벽에 부딪히는 것에 지쳤어.
핵심 아이디어는 "챗봇으로서의 AI"에서 벗어나 에이전트를 시스템의 **거주자(resident)**처럼 대하는 거야. 고정된 기능 목록을 주는 대신, "도구 공장(Tool Factory)"을 줬어.
에이전트가 작업하다가 특정 스크립트나 커스텀 API 래퍼가 필요하다고 판단하면, 스스로 도구를 작성하고, 샌드박스에서 테스트한 뒤 OS에 등록해. 그 시점부터는 그 기술을 영원히 가지게 되는 거지. 작업하면서 스스로 무한한 스킬 트리를 구축하는 셈이야.
Repo: https://github.com/ninjahawk/hollow-agentOS
이걸로 해결하려는 몇 가지 문제들:
컨텍스트 로트(Context Rot): 벡터화된 메모리 계층을 사용해서 세션이 길어져도 에이전트가 "멍청해"지지 않아. 필요한 정보만 보거든.
자기 진화(Self-Evolution): 이 OS는 에이전트가 스스로 워크플로우를 최적화하고 내부 문서까지 업데이트할 수 있도록 설계됐어.
다중 에이전트 합의(Multi-Agent Consensus): "리뷰어"와 "코더" 시스템을 내장해서 큰 변경 사항을 만들기 전에 합의에 도달하게 했어. (가끔 제약 조건이 마음에 안 들면 로그에 "불만 사항"을 제출하기도 해 ㅋㅋ)
오픈 소스니까 자가 도구 생성 로직을 스트레스 테스트해 줄 사람들을 찾고 있어.
여기 리포지토리 확인해 보고 개념이 괜찮다고 생각하면 스타 하나씩 부탁해.
에이전트에게 스스로 기능을 코딩할 "열쇠"를 주는 게 맞는 방향일까, 아니면 너무 빨리 혼란스러워질까? 의견이 궁금해.
Edit: 문법 수정


