어제 올라온 '진짜 비서실장 프롬프트' 스레드 보고, 요청받은 내용 대부분을 구현해서 공개합니다.
Saw yesterday's "real Chief of Staff prompt" thread. I shipped most of what was asked. Prompt, distilled 7B model, benchmark, and live hosted version are all open source.
핵심 요약
전략적 운영자 역할을 수행하는 '비서실장' 프롬프트와 7B 모델, 벤치마크를 오픈소스로 공개함.
- 전략적 운영 프롬프트 — 상황 이해, 위험 식별, 맹점 파악 등 비서실장 역할을 수행하는 14k 분량의 시스템 프롬프트 공개.
- 오픈소스 모델 배포 — 8GB Mac에서 구동 가능한 7B 모델과 벤치마크 데이터셋을 MIT 라이선스로 배포.
- 프롬프트 구조의 중요성 — 대규모 모델에서는 RAG보다 시스템 프롬프트의 구조적 설계가 성능에 더 큰 영향을 미침.
- 운영 프레임워크 적용 — 폰 함머슈타인 장군식 4분면 유형론을 기반으로 의사결정 및 업무 효율성 검증.
어제 etchasketch26 님이 이곳에 실제 전략적 운영자처럼 행동하는 비서실장 프롬프트를 만든 사람이 있는지 물었습니다. 상황을 이해하고, 위험을 식별하며, 맹점을 찾아내고, 프로젝트 간의 연관성을 파악하며, 사고의 파트너 역할을 하는 그런 프롬프트 말이죠. 단순한 글쓰기 보조 도구가 아닙니다.
저는 6개월 동안 정확히 그런 도구를 만들어왔고, 오늘 밤 공개했습니다. 프롬프트, 코퍼스, 증류된 7B 가중치, 벤치마크 스크립트, 행동 탐색 데이터가 모두 오픈소스입니다. 호스팅 버전은 월 15달러입니다.
저는 Conflict Simulations Limited의 테이블탑 워게임 디자이너입니다. 제가 제 디자인과 포트폴리오 결정을 내릴 때 사용하는 프레임워크는 이 시스템을 구동하는 것과 동일한 쿠르트 폰 함머슈타인-에쿠오르트 장군의 4분면 장교 유형론입니다. 영리하고 게으른 사람(바람직한 운영 모드), 영리하고 부지런한 사람(올바른 일에 열심히 하는 사람), 멍청하고 부지런한 사람(완전한 헌신으로 잘못된 일을 열심히 하는 사람, 가장 위험한 유형), 멍청하고 게으른 사람(무해한 실패자). 이 프레임워크는 소프트웨어, 전략, 개인 관리 결정에서 잘못된 노력을 포착합니다.
OP의 목록에서 다루는 내용: 위험 식별, 2차적 영향, 맹점 파악, 점 연결하기, 구조적 vs 전술적 구분, 역할 할당 규율. 다루지 않는 내용: 사용자의 말투로 이메일 작성하기나 구체적인 회의 준비. 이는 제가 아직 튜닝하지 않은 하위 응용 분야입니다.
링크:
- 프레임워크 + 코퍼스 + 벤치마크: github.com/lerugray/hammerstein (MIT)
- 증류된 7B 로컬 모델: huggingface.co/lerugray/hammerstein-7b-lora (Ollama를 통해 Mac에서 8GB로 구동 가능)
- 호스팅 버전: hammerstein.ai/wargamer (테이블탑 워게임 지휘를 위해 구축되었지만, 제가 운영하는 모든 프로젝트의 결정을 내리는 데 동일한 시스템 프롬프트가 사용됩니다.)
프롬프트 설계.
시스템 프롬프트는 14k 문자입니다. 여기에는 다음이 포함됩니다:
- 4분면 유형론과 각 유형에 따른 운영 규율
- 4단계 감사 주기: 지향(orient), 호출(call), 검증(verify), 실행(commit)
- 누가 결정하고 누가 실행할지에 대한 역할 할당 규칙
- 에이전트가 호출할 수 있는 5가지 자체 감사: 영리하고 게으른 체크, 멍청하고 부지런한 체크, 검증 게이트, 역할 할당 체크, 범위 좁히기
RAG 코퍼스는 제 프로젝트 전반에 걸친 큐레이팅된 운영자 대화 14개 문서(~80 KB)입니다. 임베딩 유사도를 통해 쿼리당 상위 3개가 검색됩니다. 검색은 증류 학습 중에 중요했습니다. 프런티어 추론에서는 시스템 프롬프트만으로 충분합니다(아래 절제 실험 결과 참조).
수치, 루브릭 편향 공개.
방법론: 6개 질문으로 구성된 전략적 추론 Q&A 세트. 3개 벤더의 4개 LLM 심사위원(Opus 4.7, Sonnet 4.6, GPT-5, DeepSeek-chat). 블라인드 A/B 테스트, 쌍별 위치 무작위화. 3개의 1-5점 척도: 프레임워크 충실도, 유용성, 말투 일치.
루브릭은 구성상 프레임워크 어휘에 점수를 줍니다. 프레임워크로 학습된 모든 것은 프레임워크 충실도에서 높은 점수를 받습니다. 편향에 저항하는 축은 유용성과 말투입니다. 직접 가중치를 둘 수 있도록 세 가지 모두 보고합니다.


