AI 퍼스트 기업 구축을 그만뒀습니다. Hermes 설정은 어떻게 하는 게 좋을까요?
I Stopped Building an AI-first company. What is the right Hermes setup should look like
핵심 요약
완전 자동화의 환상에서 벗어나, AI를 오케스트레이터와 실행자로 분리하고 검토 단계를 도입한 3단계 작업 시스템을 공유합니다.
- 3단계 작업 시스템 — 수동, 검토 기반 자동화, 완전 자동화로 업무를 분류하여 리스크를 관리함
- 오케스트레이터와 실행자 분리 — DeepSeek V4 Flash로 계획하고 Claude Code로 실제 작업을 수행함
- 결정론적 스크립트 활용 — LLM의 불확실성을 보완하기 위해 중요 작업은 스크립트로 강제함
- 칸반 보드 도입 — 에이전트의 작업 과정을 시각화하여 협업 효율을 높임
"직원 0명인 자율 AI 기업" 같은 헛소리에 완전히 질려버려서 2달 동안 손 뗐다가 다시 돌아왔다. 돌아와서 깨달은 내 진짜 실수는 작업을 이분법적으로만 생각했다는 거다. 'AI가 할 수 있냐, 없냐'만 따진 거지. 근데 진짜 핵심은 **중간 단계(middle tier)**에 있었어. AI가 대부분 잘 해내긴 하는데, 검토가 꼭 필요한 위험한 작업들 말이야. 지금은 Hermes를 저렴한 오케스트레이터(DeepSeek V4 Flash)로 돌리고, 실제 작업은 Claude Code한테 다 떠넘기는 식으로 운영 중이다. 중간에 칸반 보드 하나 껴두고 말이지. LLM 호출을 결정론적 스크립트로 감싸버리니까 "아차, 상태 업데이트 까먹었네" 같은 문제도 싹 해결됐다.
Openclaw를 한 2달 정도 쓰다가 4월에 Anthropic이 에이전트용 구독 사용을 막아버려서 때려치웠다. 그러고 또 2달 동안 레이스에서 빠져서 지냈지. 인터넷 어딜 가나 자동화로 돈 복사한다는 소리뿐이라 지긋지긋했거든. 똑똑하고 기술 좀 안다는 놈들도 다 거기에 낚이더라.
다시 돌아와서 생각해보니 내 실수가 뭔지 딱 보이더라고. 모든 작업을 AI가 할 수 있는 것과 없는 것으로만 나눴던 거다. 그런 식으로 접근하면 에이전트가 불안정해서 계속 옆에서 애 보듯 지켜봐야 하고, 결국 그냥 노트북 켜서 Claude 쓰는 거랑 다를 게 없어져.
내가 놓친 건 그 중간 영역이었다. 그래서 3단계 시스템으로 바꿨다.
- 1단계 — 수동 전용: 내가 직접 하는 개인적인 일들. 그래도 에이전트한테는 능동적으로 움직이라고 시킨다. (예: "이메일 초안 써놔", 어차피 보내는 건 내가 하지만.)
- 2단계 — 검토 단계가 있는 자율 작업: 주로 코딩. 에이전트가 기능을 만들어서 프리뷰 브랜치에 올리고, 나한테 보고서랑 링크를 보낸다. 내가 검토하고 승인하면 배포되는 식. 내가 그동안 무시했던 단계인데, 여기서 진짜 가치가 다 나온다.
- 3단계 — 완전 자율: 주기적으로 돌아가는 작업들. 매주 SEO 수정, 보안 검토, 앱 가용성 테스트 같은 거. 처음부터 끝까지 알아서 돌아가고 난 결과 보고서만 받는다. 이건 진짜 위험 요소까지 다 따져본 다음에만 넣어야 함.
효과 본 세팅:
- 저렴한 VPS에 호스팅 (Hetzner, 4코어/8GB에 월 10달러 정도면 99%는 커버됨).
- Hermes를 오케스트레이터로 쓰고, 뇌 역할은 DeepSeek V4 Flash가 담당. 싸고 빠르고 생각보다 똑똑하다. 얘는 대화하고, 계획 짜고, 위임하는 역할만 한다. 파일이나 코드, 설정은 절대 직접 안 건드림.
- Claude Code를 실행기로 사용. 실제 작업(백엔드, 프론트엔드, DB, 보안, 테스트, 배포)은 내가 1년 동안 쌓아온 가이드라인 안에서 돌아간다. 이렇게 위임하면 API 비용 낭비할 필요 없이 내 기존 Max 구독 한도 내에서 해결 가능함.
- 중간에 칸반 보드를 박아놔서 모든 작업, 코멘트, 결정 사항이 기록된다. 동료가 일하는 걸 옆에서 지켜보는 느낌이라 아주 좋다.
따라 하면 좋을 꿀팁 하나: 워크플로우를 .md 스킬 파일로 관리하면 최상급 모델들도 대부분은 잘 따라오는데, 가끔 단계를 "까먹는" 경우가 있다. "아 맞네, 그거 깜빡했네" 이러면서. 이걸 해결하려면 LLM 실행 과정을 결정론적 스크립트(Python/JS 등)로 감싸버리면 된다. 그럼 LLM이 돌기 전에 칸반 카드를 생성하는 것처럼 중요한 작업들을 하드코딩해서 절대 빼먹지 못하게 만들 수 있다. 비결정론적인 핵심을 결정론적인 뼈대로 감싸는 거지.
모든 걸 해결해 준 사고의 전환: 모델한테 대신 생각하라고 하지 마라. 대신 위임할 수 있을 만큼 똑똑한 모델 중 가장 싼 걸 골라 써라.

