모델 지능을 과대평가하고 워크플로우 품질을 과소평가하고 있는 건 아닐까?
Are we overestimating model intelligence and underestimating workflow quality?
핵심 요약
AI의 성능은 모델 자체보다 컨텍스트, 메모리, 도구 접근성 등 워크플로우 설계가 결정한다는 주장.
- 워크플로우의 중요성 — AI의 마법 같은 성능은 모델보다 주변 워크플로우 설계에서 나옴.
- 운영 파이프라인 — 프로덕션 시스템은 챗봇보다는 운영 파이프라인처럼 작동해야 함.
- 에이전트 실패 원인 — 대부분의 실패는 모델 문제가 아니라 컨텍스트 관리나 검증 부족 등 워크플로우 결함임.
- 기술적 해자 — 모델 자체의 성능보다 워크플로우 아키텍처가 실질적인 경쟁 우위가 되고 있음.
AI 시스템을 다룰수록 "마법처럼 느껴지는 AI"와 "쓸모없게 느껴지는 AI"의 가장 큰 차이는 모델 자체가 아니라 그 주변의 워크플로우라는 생각이 듭니다.
같은 모델, 같은 API를 써도 결과는 완전히 달라집니다. 다음 요소들에 따라서 말이죠:
- 컨텍스트 품질
- 메모리 구조
- 도구 접근성
- 검색(Retrieval) 품질
- 관측 가능성(Observability)
- 인간 피드백 루프
- 오케스트레이션 로직
여전히 많은 사람이 AI를 단순히 고립된 프롬프트로만 평가하지만, 프로덕션 시스템은 점점 챗봇보다는 운영 파이프라인의 형태를 띠고 있습니다.
또한 대부분의 "에이전트 실패"는 사실 워크플로우의 실패인 경우가 많습니다:
- 잘못된 컨텍스트 검색
- 부실한 상태 관리
- 취약한 검증
- 폴백(Fallback) 로직 부재
- 불분명한 작업 분해
- 모니터링/평가 부족
반면, 탄탄한 워크플로우를 갖춘 소형 모델이 엉망인 환경에서 돌아가는 대형 모델보다 더 나은 성능을 내기도 합니다.
이런 변화를 느끼고 계신 분들이 또 있는지 궁금합니다.
진정한 해자(Moat)는 원시적인 모델 성능이 아니라 워크플로우 아키텍처가 되어가고 있는 걸까요?

