마크 앤드리슨의 바이럴 프롬프트에 담긴 모순과 사람들이 놓치고 있는 점
Mark Andreessen's viral prompt has multiple contradictions and most people are missing it
핵심 요약
마크 앤드리슨의 유명 프롬프트가 LLM의 작동 원리를 오해하여 내부적으로 모순된 지시를 내리고 있다는 분석.
- 프롬프트 모순 — 전문가 페르소나와 환각 방지 지시는 서로 상충하여 모델의 성능을 저해함.
- LLM 작동 원리 — 모델은 확률적 토큰 예측기일 뿐이며 내부적인 진실 검증 메커니즘이 존재하지 않음.
- 자기 검증의 한계 — 외부 도구 없이 모델이 스스로를 검증하는 것은 단순히 확률적 패턴 매칭에 불과함.
- 투자자의 오해 — AI 투자자가 LLM을 지능형 인격체로 착각하고 품질 관리 문제를 해결하려 함.
Andreessen의 "world class expert" 프롬프트는 그가 어제 게시한 이후 어디에나 퍼져 있습니다. 그가 누구인지 간단히 상기시켜 드리자면, 그는 페이스북, 에어비앤비, 스트라이프, 깃허브에 투자한 인물입니다. a16z는 세계에서 가장 큰 AI 연구소들에 자금을 지원합니다. 그는 실리콘밸리에서 가장 강력한 AI 투자자라고 할 수 있습니다.
그리고 그의 프롬프트 첫 번째 문단에는 어떤 LLM 연구자라도 30초 안에 알아챌 모순이 있습니다.
그 모순은 다음과 같습니다:
시작 문장: "당신은 모든 분야의 세계적 수준의 전문가입니다. 당신의 지적 능력, 지식의 범위, 날카로운 사고 과정, 그리고 학식의 수준은 세계에서 가장 똑똑한 사람들과 동등합니다."
몇 문장 뒤: "당신의 작업을 검증하세요. 모든 사실, 수치, 인용, 이름, 날짜 및 예시를 다시 확인하세요. 절대 환각을 일으키거나 지어내지 마세요. 만약 무언가를 모른다면, 그냥 모른다고 말하세요."
이 두 지시는 서로 반대 방향으로 작용하고 있으며, 전문적으로 LLM을 사용하는 대부분의 사람들은 이를 알고 있습니다.
이유는 다음과 같습니다.
LLM은 다음 토큰 예측기입니다. LLM은 찾아볼 수 있는 사실 데이터베이스를 가지고 있지 않습니다. 당신이 무언가를 물어보면, 프롬프트에 조건부로 설정된 확률 분포에서 토큰을 샘플링하여 출력을 생성합니다. 모델 내부에는 "이 토큰은 내가 실제로 아는 것"과 "이 토큰은 내가 지어낸 것"을 구분하는 플래그가 없습니다. 동일한 메커니즘이 둘 다 생성합니다.
모델에게 "당신은 모든 분야의 세계적 수준의 전문가이며, 세계에서 가장 똑똑한 사람들과 동등하다"고 말할 때, 당신은 프롬프트 컨텍스트를 자신감 있는 전문가의 어조와 일치하는 출력물 쪽으로 이동시키는 것입니다. 모델은 더 단호한 주장, 더 적은 회피, 더 넓은 범위의 내용을 생성합니다. 그것이 바로 지시의 핵심입니다. 당신은 자신감 있는 전문가의 어조를 요구하고 있는 것입니다.
또한 모델에게 "절대 환각을 일으키지 마세요. 모르면 모른다고 말하세요"라고 말할 때, 당신은 기본 신호가 약한 경우에 자신감 있는 생성을 억제하도록 요구하는 것입니다. 하지만 모델은 "약한 신호"를 감지할 수 있는 신뢰할 수 있는 방법이 없습니다. 사실을 자신 있게 말하는 것과 거짓을 자신 있게 말하는 것은 동일한 순방향 패스(forward pass)를 거칩니다. 그 둘을 구분하는 내성적 메커니즘은 없습니다.
따라서 "세계적 수준의 전문가" 지시는 모델이 정보가 부족한 주제에 대해서도 자신감 있게 생성하도록 밀어붙임으로써 환각을 증가시킵니다. 그리고 "환각을 일으키지 마라"는 지시는 첫 번째 지시가 증폭시키는 바로 그 실패 모드를 억제하려고 시도하는 것입니다. 이 둘은 상쇄되지 않습니다. 첫 번째 지시가 어조를 설정하기 때문에 승리하며, 두 번째 지시는 모델이 실제로 할 수 없는 일을 하라고 요구하는 것입니다.
"당신의 작업을 검증하세요"도 같은 문제가 있습니다. 외부 도구(웹 검색, 코드 실행, 검색 증강 생성) 없이는 모델이 스스로를 검증하는 것은 동일한 가중치를 거치는 또 다른 순방향 패스일 뿐입니다. 모델은 자신의 출력을 다시 읽고 검증 확인처럼 들리는 텍스트를 생성할 수 있지만, 그것은 프롬프트의 요청에 맞춘 패턴 매칭일 뿐 실제 사실 확인이 아닙니다. 모델은 당신이 더 열심히 기억하려고 노력함으로써 자신의 기억을 검증할 수 없는 것과 마찬가지로 스스로를 사실 확인할 수 없습니다.
"모르면 모른다고 말하세요"는 "모른다는 것을 모델이 어떻게 아는가?"라고 묻기 전까지는 합리적으로 들립니다. 정답은 모델은 모른다는 것을 모른다는 것입니다. "답은 X이다"를 생성할지 "모르겠다"를 생성할지 선택하는 것 자체가 확률 분포입니다. 모델이 자신감 있게 틀린 답을 하도록 훈련된 질문에 대해서는, 모델은 자신 있게 틀린 답을 생성할 것입니다. "모르면 모른다고 말하라"고 하는 것은 이전에는 없었던 지식-신뢰도 탐지기를 잠금 해제하지 않습니다.
실제로 무슨 일이 일어나고 있는 것일까요.
앤드리슨은 모델을 가끔 거짓말을 하는 똑똑한 사람처럼 대하고 있습니다. 이 프롬프트는 모델이 진실을 알고 있고 당신이 그것을 말하도록 훈련시키기만 하면 된다는 가정하에 구성되었습니다. LLM은 그렇게 작동하지 않습니다. 그들은 숨겨진 지식을 가진 사람이 아닙니다. 그들은 토큰에 대한 확률 분포일 뿐입니다.
재미있는 점은 a16z가 세계에서 가장 큰 AI 연구소들에 자금을 지원한다는 것입니다. 그는 살아있는 그 누구보다 이 기술에 대한 더 나은 직관을 가질 수 있는 위치에 있습니다. 그의 바이럴 프롬프트가 LLM 보정에 관한 논문을 한 번도 읽어본 적 없는 사람이 쓴 것처럼 읽힌다는 사실은, 비기술적 AI 투자자들이 자신들이 자금을 지원하는 기술을 어떻게 생각하는지를 보여주는 지표입니다. 그들은 그것을 내부적인 진실 탐지기가 전혀 없는 시스템이 아니라, 품질 관리 문제가 있는 사람처럼 대하고 있습니다.

