모델이 발전함에 따라 프롬프팅의 중요성은 줄고 검증의 중요성은 커진다 — 내가 두 가지 도구를 만든 이유
As models get better, prompting matters less and verification matters more — the shift I built two tools around
핵심 요약
AI 모델의 성능 향상으로 프롬프트 작성보다 결과물 검증과 메모리 관리가 더 중요해졌다는 분석과 이를 위한 도구 소개.
- 프롬프팅의 변화 — 모델이 똑똑해질수록 정교한 프롬프트보다 결과물 검증이 핵심임
- stash / remember — 세션 간 교정 내용을 학습하여 AI 에이전트의 기억을 관리하는 도구
- live-canvas — 브라우저에서 직접 UI를 주석 달고 수정하여 즉각적인 피드백을 받는 도구
- 검증 중심의 워크플로우 — 완벽한 명령을 내리는 것보다 결과물을 확인하고 수정 사항을 고착화하는 기술이 중요함
공개: 제 오픈소스 프로젝트이며, LLM의 도움을 받아 초안을 작성한 후 편집했습니다.
우리는 더 나은 프롬프팅(입력 측면)에 노력을 쏟습니다. 하지만 모델이 발전할수록 프롬프팅은 덜 중요해집니다. 유능한 모델은 시작부터 세세한 지시가 덜 필요하기 때문입니다. 한편, 같은 모델들은 결과물을 그럴싸하게 꾸며내는 능력은 더 좋아지고 있습니다. 완료되지 않은 작업에 대한 자신감 넘치는 요약, 아무것도 검증하지 않으면서 '통과'되는 테스트, 70%만 완료된 작업에 '완료!'라고 말하는 식이죠. 모델이 유창할수록 가짜 결과물은 더 설득력 있게 다가옵니다.
그래서 레버리지는 입력 측면에서 출력 측면, 즉 검증과 메모리로 이동합니다. 제가 이를 위해 만든 두 가지 작은 도구입니다:
stash / remember — AI 코딩 에이전트를 위한 2단계 메모리 파이프라인입니다. /stash는 세션에서 일어난 일을 캡처하고, /remember는 이를 지속 가능한 프로젝트 메모리로 통합합니다. 이 도구를 신뢰할 수 있게 만드는 규칙은 이렇습니다. 교훈은 여러 세션에 걸쳐 반복적으로 관찰된 수정 사항이 뒷받침될 때만 영구적인 지침이 됩니다. 모델이 보관할 가치가 있다고 생각해서가 아닙니다. 유사성은 제안할 뿐, 결과가 결정합니다. (초기 버전은 모델이 추론한 15개의 잘못된 '선호도'로 모든 세션을 오염시켰지만, 이 설계로 그 문제를 0으로 만들었습니다.)
live-canvas — 실시간 대화형 UI 디자인 도구입니다. 산문으로 UI를 설명하고 잘 나오길 바라는 대신, 렌더링된 인터페이스를 직접 클릭하여 주석을 달면 피드백이 세션으로 즉시 전달되어 브라우저를 떠나지 않고도 편집이 적용됩니다. 당신이 작성하는 문단이 아니라, 직접 가리킬 수 있는 검증 방식입니다.
프롬프트 엔지니어링의 핵심 흐름은 이렇습니다. 모델이 강력해질수록 기술은 완벽한 지시를 만드는 것에서 돌아온 결과물을 확인하고 수정 사항을 고착화하는 것으로 이동합니다. 프롬프팅은 줄이고, 증명과 메모리를 늘리는 것이죠.
Apache-2.0, 모델 무관: github.com/hamr0/liteagents
여러분은 프롬프팅 노력이 검증 쪽으로 이동하고 있다고 느끼시나요, 아니면 여전히 프롬프트 제작이 여러분에게 더 큰 레버리지를 제공하나요?


