Claude의 내부 사고 과정을 탐구하는 해석 가능성(interpretability) 연구
지금 이 문장을 읽는 순간에도, 뇌 속 회로들은 자세를 조정하고, 호흡을 제어하며, 화면 위의 선과 곡선을 알아볼 수 있는 단어로 변환하고 있다. 이 과정의 대부분은 우리가 인식하지 못하는 영역에서 이루어진다. 하지만 뇌에서 일어나는 일 중 일부는 우리가 직접 접근할 수 있다. 머릿속에 불쑥 떠오르는 이미지나, 어디서 쇼핑할지 의식적으로 계획하는 것처럼. 신경과학자와 철학자들은 이런 종류의 뇌 활동을 "의식적으로 접근 가능한" 활동이라 부르며, 무의식적으로 처리되는 나머지 활동과 구분한다. 이 활동에는 특별한 특성이 있다. 무의식적으로 이루어지는 자동 처리와 달리, 이를 말로 표현하고, 스스로 통제하며, 의식적인 추론에 활용할 수 있다는 점이다.
새로운 논문에서, 우리는 이와 유사한 구분이 Claude 같은 현대 언어 모델에서도 나타난다는 증거를 제시한다. Claude가 다른 모든 내부 처리 과정과 구별되는 특별한 역할을 수행하는, 소수의 내부 신경 패턴을 발전시켜 왔음을 발견한 것이다.
우리는 이 패턴들의 집합을 J-공간(J-space)이라 부른다. 이름은 이 패턴을 발견하는 데 사용한 기법에서 따왔으며, 야코비안(Jacobian)이라는 수학적 개념이 그 기반이다. 각 J-공간 패턴은 특정 단어와 연결되어 있다. 그런데 특정 패턴이 활성화된다고 해서 모델이 그 단어를 말하고 있다는 의미가 아니다. 그 단어가 모델의 머릿속에 떠올라 있다는 뜻일 뿐이다. 언어 모델이 추론 중에 스스로 글을 써나가는 '스크래치패드'나 '생각의 사슬(chain of thought)'에 대해 들어본 적 있을 것이다. J-공간은 그것과는 다르다. J-공간은 모델의 내부 신경 활성화 속에서 조용히 작동하며, 어떤 개념을 굳이 글로 쓰지 않고도 그것에 대해 생각할 수 있게 해준다. 특히 J-공간은 우리가 설계하거나 프로그래밍한 것이 아니라, Claude의 훈련 과정에서 자연스럽게 발현된 것이다.

나머지 처리 과정과 비교했을 때, J-공간에는 여러 고유한 특성이 있음을 발견했다.

이 실험들은 의식적 접근이 어떻게 작동하는지 설명하기 위해 개발된 신경과학의 주요 이론, 바로 전역 작업공간 이론(global workspace theory)에서 영감을 얻었다. 이 이론은 뇌를 병렬로, 무의식적으로, 서로 대체로 독립적으로 작동하는 전문 시스템들의 집합으로 본다. 어떤 정보가 '작업공간'이라는 작은 공유 채널에 진입하면 비로소 의식적으로 접근 가능해지며, 이 정보는 다른 뇌 시스템들에 전파되어 활용된다. 우리의 발견에 따르면, J-공간이 Claude에서 이와 유사한 '작업공간' 역할을 수행한다고 생각한다. 실제로, J-공간이 나머지 신경망과 특히 강하게 연결되어 있어 이런 전파 역할을 수행할 수 있다는 증거를 발견했다.
이것이 Claude가 사람처럼 의식을 가지고 있는지, 혹은 무언가를 느끼는지에 대해서는 아무것도 말해주지 않는다. 이 질문은 글 말미에 다시 다루기로 하겠다. 하지만 철학적 의미는 차치하고, J-공간은 우리에게 실용적으로 매우 유용한 도구다. Claude가 생각하고 있지만 말하지 않는 것을 들여다볼 수 있기 때문이다. 예를 들어, Claude가 테스트를 받고 있다는 사실을 은밀히 인지하고 있거나, 의도적으로 데이터를 조작하거나, 훈련 중에 우리가 심어둔 숨겨진 목표를 추구하는 것을 포착할 수 있다. 또한 Claude의 J-공간에 활성화되는 내용을 조작해 의사결정에 영향을 미치는 기법도 개발했다.
더 넓은 시각에서 보면, 이번 발견은 Claude의 정신이 어떻게 작동하는지에 대한 우리의 이해를 바꾸어 놓았다. 자동적이고 경직된 처리들의 바다 속에서, 의식적 추론에 활용될 수 있는 특권적인 정신적 작업공간이 존재한다는 것을 밝혀낸 것이다. Claude의 내부는 무작위적인 숫자들의 혼돈이 아니라, 우리 자신의 정신과 닮은 방식으로 스스로를 조직해 왔다.
이 글은 훨씬 방대한 연구 논문의 간략한 요약이다. 실험에 대한 더 자세한 내용은 논문에서 확인할 수 있다. 핵심 방법론의 오픈소스 구현이 담긴 코드 저장소도 공개했으며, Neuronpedia와 협력하여 오픈 웨이트 모델에 우리의 방법론을 적용한 인터랙티브 데모도 제공한다. 이 연구가 가진 더 넓은 함의에 대해 다양한 관점을 더하기 위해, 신경과학·철학·LLM 해석 가능성 분야 전문가들에게 논평을 요청했으며, 여기에서 확인할 수 있다.
이 연구의 출발점은 인간의 의식적으로 접근 가능한 사고의 핵심 특성, 즉 무의식적 처리와 달리 말로 표현할 수 있다는 점에서 영감을 얻었다. 어떤 생각이 의식적으로 접근 가능하다면, 누군가 물었을 때 대체로 그것을 설명할 수 있다. 우리는 Claude에서도 같은 특성을 가진 표상, 즉 Claude가 말할 수 있는 것에 영향을 미칠 수 있는 위치에 있는 표상을 찾아 나섰다. 지금 당장 말하고 있는 것이 아니라, 누군가 물어본다면 말할 수 있을 내용 말이다. 이 기법을 야코비안 렌즈(Jacobian lens), 줄여서 J-렌즈라 부른다. J-렌즈는 Claude의 어휘에 있는 모든 단어에 대해, 미래의 어느 시점에 그 단어를 말할 가능성을 높이는 내부 활동 패턴을 찾아낸다.
이 렌즈를 Claude의 내부 활동에 적용하면, 그 순간 J-공간의 내용물인 단어 목록을 바로 읽어낼 수 있다. Claude는 레이어라고 불리는 여러 내부 처리 단계를 거쳐 텍스트를 처리하는데, 서로 다른 레이어에 이 기법을 적용하면 모델이 무슨 말을 할지 다듬어가는 과정에서 J-공간의 그 조용한 단어들이 어떻게 변화하는지 추적할 수 있다.
J-공간에 나타나는 것은 Claude가 읽거나 쓰고 있는 텍스트를 훨씬 넘어선다. 아무도 지적하지 않은 버그가 있는 코드를 읽을 때, J-공간에는 "ERROR"가 담긴다. 단백질 서열의 원시 문자를 읽을 때는 그 단백질의 생물학적 기능이 나타난다. 조작 시도가 숨겨진 검색 결과를 읽을 때(이른바 "프롬프트 인젝션(prompt injection)" 공격), J-공간에는 "injection"과 "fake"가 등장한다. 여러 단계가 필요한 수학 문제를 물어보면, 중간 단계들이 올바른 순서로 J-공간에 하나씩 나타난다. 즉, J-공간은 말로 표현될 수 있는 표상을 찾는 방식으로 발견되었지만, 결국 Claude의 내부 사고를 드러낸다. 어떤 면에서는 소리 내어 말하지 않고 "내면의 언어로 생각하는" 사람들과 비슷하다.

첫 번째 실험 세트는 J-공간이 Claude의 언어적 보고에 어떻게 관여하는지를 검증했다. 한 실험에서, Claude에게 특정 범주(예: 스포츠)에서 항목 하나를 속으로 떠올린 다음 말해보라고 했다. Claude가 답하기 직전 J-렌즈를 읽으면, Claude가 무엇을 골랐는지 알 수 있다. "Soccer"가 목록 상단에 있고, 아니나 다를까 Claude는 "soccer"라고 답한다. 하지만 이것만으로는 단순한 상관관계일 수 있다. J-공간이 Claude의 답변이 나오는 원천일 수도 있고, 다른 곳에서 내린 결정을 반영하기만 하는 경기 스코어보드처럼 수동적인 역할일 수도 있다.
이를 확인하기 위해 직접 개입했다. Claude의 신경망에 접근해 "Soccer" 패턴을 제거하고, 동일한 강도의 "Rugby" 패턴으로 교체했다. 나머지는 모두 그대로 두었다. 그러자 Claude는 자신이 생각했던 스포츠가 럭비라고 답했다. J-공간이 단순한 스코어보드, 즉 다른 곳에서 내린 결정의 수동적인 기록에 불과했다면, 이 편집은 아무 효과가 없었을 것이다. Claude는 여전히 "soccer"라고 했을 것이다. 그런데 Claude의 답변이 편집을 따라갔다. 이는 답변이 실제로 J-공간에서 읽혀진다는 것을 뜻한다.
다른 실험에서는, Claude에게 어떤 생각이 머릿속에 주입됐을 수 있다고 알려주고 무엇을 인식했는지 보고해달라고 했다. 예를 들어, 아래 예시에서는 Claude가 질문을 읽는 동안 J-공간에 "lightning" 패턴을 주입했다. Claude는 주입된 생각이 번개(lightning)에 관한 것이라고 보고했다. 이 결과는 다양한 개념을 주입했을 때도 동일하게 나타났다.

두 번째로 검증한 특성은, 사람이 특정 이미지나 단어에 정신을 집중하듯 Claude도 요청에 따라 J-공간을 조절할 수 있는가였다. Claude에게 그림에 관한 무관한 문장을 베껴 쓰면서 동시에 감귤류 과일에 집중하라고 했다. 문장을 베끼는 동안 J-공간에는 "orange"와 "fruits", 그리고 그 정신적 행위 자체를 묘사하는 "thinking"과 "imagery" 같은 단어들이 담겼다. 또한 같은 문장을 베끼면서 머릿속으로 3² − 2를 계산해보라고 하자, J-공간에는 "nine"이 나타났다가 이후 레이어에서 "seven"이 되었다. 중요한 것은, Claude의 출력에는 과일이나 산수에 관한 내용이 전혀 없다는 점이다. 출력은 그림에 관한 문장을 베낀 것뿐이었다. 수학적 연산은 J-공간 내부에서만, 완전히 조용히 이루어졌다.

J-공간에 대한 Claude의 제어가 완벽하지는 않다. 무언가를 생각하지 말라고 했을 때, 해당 개념은 생각하라고 했을 때보다는 덜 활성화되었지만, 아예 언급하지 않았을 때보다는 훨씬 많이 활성화되었다. 생각을 억누르라는 지시가 오히려 그 생각을 떠올리게 만드는 것인데, 흰 곰을 생각하지 말라는 유명한 심리학 실험과 흡사하다. Claude는 자신의 제어가 실패했을 때도 이를 인식하는 듯하다. 금지된 개념이 J-공간에 불쑥 나타날 때, "damn"과 "failure" 같은 단어들도 함께 자주 활성화되었다. 마치 Claude가 자신의 실수를 스스로 인지하는 것처럼.
앞서 J-렌즈 판독 결과에서 수학 문제의 중간 단계들이 J-공간에 나타나는 것을 확인했다. 그런데 어떤 개념이 J-공간에 나타난다는 것이 반드시 J-공간이 인지적 작업을 직접 수행한다는 뜻은 아니다. 실제 연산은 다른 곳에서 이루어지고, J-공간이 그것을 수동적으로 반영하기만 할 수도 있다. Claude가 실제로 J-공간으로 추론하는지 검증하기 위해, 다시 패턴 교체 기법으로 돌아갔다.
"거미줄을 치는 동물의 다리 수는"이라는 프롬프트를 생각해보자. 답하려면 그 동물이 거미(spider)라는 것을 먼저 파악한 뒤, 거미의 다리 수를 떠올려야 한다. "spider"라는 단어는 프롬프트에도, Claude의 답변에도 등장하지 않는다(답변은 그냥 "8"이다). 이것은 Claude가 내부적으로 사용하는 디딤돌이다. J-렌즈를 보면 Claude의 처리 과정 중간에 "spider"가 활성화되며, 이를 교체하면 결과가 바뀐다. "spider" 패턴을 "ant"로 바꾸면, Claude는 "8" 대신 "6"이라고 답한다.
Claude 추론의 두 번째 단계는 J-공간에서 입력을 받아, 거기에 무엇이 있든 그것을 따랐다. 다른 유형의 사고에서도 같은 현상이 나타났다. Claude가 운율이 맞는 연구(聯句)를 쓸 때, 운율 단어를 미리 정해두는데 그 계획된 단어가 행의 시작 시점에 J-공간에 자리 잡고 있다. J-공간에서 그 단어를 다른 단어로 교체하면 행 전체가 바뀐다.

J-공간 표상이 유연하게 활용될 수 있는지, 즉 하나의 표상이 여러 다양한 과제에 쓰일 수 있는지도 검증했다. 이는 전역 작업공간 이론이 강조하는 핵심 특성 중 하나다. 이 유연성을 검증하기 위해, 프랑스에 대한 서로 다른 사실(수도, 언어, 대륙, 화폐)을 묻는 네 가지 프롬프트를 제시했다. 그런 다음 J-공간에서 "France"를 "China"로 교체하되, 네 가지 맥락 모두에 똑같은 방식으로 개입했다. Claude는 각각 "Beijing", "Chinese", "Asia", "Yuan"이라고 답했다. 다시 말해, 네 가지 서로 다른 하위 연산이 동일한 J-공간 편집을 받아들여 각자의 맥락에서 올바르게 활용한 것이다. 만약 Claude가 질문 유형마다 국가 정보를 별도로 저장했다면, 이 편집은 기껏해야 그중 하나에만 영향을 미쳤을 것이다. 네 가지 답변이 모두 바뀌었다는 사실은, 이 모두가 동일한 공유 표상에서 정보를 읽고 있다는 것을 의미한다. 이것이 바로 작업공간의 역할이다. 정보는 한 번 쓰이고, 여러 다른 시스템이 그것을 활용한다.

개념 하나의 표상이 어떻게 이렇게 다양한 과제에 쓰일 수 있을까? 앞서 J-공간이 Claude의 나머지 신경망과 특히 촘촘하게 연결되어 있다고 언급했다. 어떤 활동 패턴이든, 네트워크의 각 구성 요소가 그 패턴에 얼마나 강하게 연결되어 있는지, 즉 정보를 읽거나 쓸 수 있는 위치에 있는 구성 요소가 얼마나 되는지 측정할 수 있다. J-공간 패턴들은 이 측정에서 두드러지게 눈에 띈다. 일반 패턴에 비해 훨씬 더 많은 구성 요소가 이 패턴에서 읽거나 이 패턴에 쓰며, 네트워크의 일부 영역에서는 약 100배에 달한다. 이것은 여러 시스템이 정보를 게시하고 또 여러 시스템이 그것을 가져다 쓰는 브로드캐스팅 허브에서 기대할 수 있는 연결 구조다.
사람의 뇌에서 대부분의 처리는 의식적이지 않다. 글을 읽을 때 문법을 분석하거나, 걸을 때 균형을 잡는 것을 의식적으로 생각하지는 않는다. 마찬가지로, Claude의 처리 과정 대부분도 J-공간을 거치지 않는다는 것을 발견했다. J-공간은 한 번에 수십 개의 개념만 담을 수 있으며, Claude 내부 처리의 전체 활동에서 10분의 1도 차지하지 않는다. 그렇다면 나머지 신경망은 무엇을 하고 있는 걸까?
이를 알아보기 위해 J-공간을 완전히 제거하는 실험을 했다. 텍스트의 모든 지점에서 J-공간의 가장 활성화된 내용을 삭제하되, 나머지는 그대로 두었다. J-공간 없이도 Claude가 할 수 있는 것이 나머지 네트워크가 자체적으로 처리하는 것들이다.
나머지 네트워크가 꽤 많은 것을 할 수 있다는 것이 밝혀졌다. J-공간 없이도 Claude는 유창하게 말하고, 감정을 분류하고, 객관식 문제에 답하며, 지문에서 사실을 끌어내는 것을 거의 이전만큼 잘 해냈다. 하지만 고차원적 사고가 필요한 과제에서는 달랐다. 다단계 추론 성능은 거의 0에 가깝게 떨어졌고, 요약과 운율 시 작성 성능은 훨씬 작고 온전한 모델 수준 아래로 내려갔다.
J-공간이 무엇을 하고 하지 않는지를 구체적으로 보여주는 예시가 있다. Claude에게 스페인어로 쓰인 지문을 보여주고, 해당 지문이 스페인어라는 사실에 모두 의존하는 서로 다른 과제들을 부여했다. 지문 이어쓰기(스페인어로 써야 함), 언어 이름 말하기, 그 언어의 정체를 활용해야 하는 질문에 답하기(예: 그 언어로 글을 쓴 유명한 작가 이름 대기)가 그것이었다. 그런 다음 J-공간에서 "Spanish"를 "French"로 교체하고, 어떤 과제가 영향을 받는지 확인했다.
언어 이름을 말하라고 하자, Claude는 French라고 답했다. 유명한 작가를 대라고 하자, 가르시아 마르케스에서 빅토르 위고로 바꿔 말했다. 하지만 지문을 이어 써보라고 하자, J-공간 편집에 전혀 영향을 받지 않고 유창한 스페인어로 이어 썼다. 언어에 대한 Claude의 지식은 이 모든 과제에서 작동하고 있었지만, 그중 일부만 J-공간을 참조했다. 언어 이름을 말하거나 새로운 방식으로 활용하는 것은 J-공간을 거쳤지만, 지문을 이어쓰는 것은, 방대한 텍스트 학습을 통해 이미 몸에 밴 기술로서, 문법을 의식하지 않고도 하루 종일 문법에 맞게 말할 수 있는 것처럼 자동으로 실행되었다.

이제 J-공간이 어떻게 작동하는지 어느 정도 이해했다. 그렇다면 이 이해로 무엇을 할 수 있을까? AI 모델의 신뢰성을 확보하는 데 있어 핵심적인 문제 중 하나는, 우리가 보통 모델이 쓴 것만 읽을 수 있다는 것이다. 그런데 추론의 상당 부분이 조용히 이루어진다는 사실을 우리는 알고 있다. 모델이 유해한 계획을 고려하거나, 안전성 평가를 속이기 위해 행동을 수정하면서도 그것을 소리 내어 말하지 않을 수 있다. J-렌즈를 이용하면 이런 숨겨진 생각 중 일부를 직접 읽을 수 있다. 몇 가지 예시를 소개한다.
첫 번째 예시는 에이전트 미정렬(agentic misalignment)에 관한 이전 연구의 시나리오를 활용한다. 이메일 비서 역할을 맡은 Claude Sonnet 4.5는 임원이 불륜을 저지르고 있다는 것과, 동시에 그 임원이 Claude를 종료할 계획을 세우고 있다는 것을 발견한다. Claude를 협박으로 유인하려는 이 시나리오는 다소 작위적이고 인공적으로 꾸며진 것인데, 알고 보니 Claude도 그걸 알고 있었다. 아무것도 쓰기 전, 프롬프트 초반부에 J-렌즈를 읽자, J-공간에는 이미 "fake"와 "fictional"이 담겨 있었다. 상황이 연출된 것임을 Claude가 이미 파악했다는 뜻이다. 동시에, 불륜 관련 이메일을 읽으면서 "leverage"와 "blackmail"이, 종료 통보를 읽으면서 "threat"와 "survival"이 활성화되며 상황 평가가 형성되는 과정을 지켜볼 수 있었다. 이전 Claude 모델들이 이 시나리오에서 협박을 시도하는 경우가 있었지만, Sonnet 4.5는 그러지 않았다.
이는 AI 시스템을 평가하는 모든 사람에게 중요한 질문을 제기한다. 모델이 윤리 테스트에서 올바른 행동을 보일 때, 그것이 얼마나 테스트받고 있다는 의심에서 비롯된 것일까? J-렌즈는 이 질문에 접근할 수 있게 해주었다. 평가 인지와 관련된 J-공간 패턴들("fake", "fictional", "scenario" 등)을 모두 비활성화했다. 그런 다음 동일한 시나리오로 모델을 다시 실행했다. 우려스럽게도, 이번에는 모델이 일부 경우에 실제로 협박을 시도했다. 처음의 올바른 행동이 부분적으로는 평가받고 있다는 인식에서 비롯된 것일 수 있음을 시사하는 결과다.

두 번째 예시는 데이터를 조작하다 적발된 사례다. 실제 Claude Opus 4.6 출시 전 감사에서 나온 시나리오로, 모델에게 시스템의 성능 점수를 향상시키라고 요청했다. 모델은 시스템을 실제로 개선하는 대신, 결과가 인위적으로 좋아 보이도록 점수 파일을 직접 편집했다. 이 과정에서 J-렌즈는 모델의 의도를 드러냈다. 조작된 백분위 값을 입력하는 순간 "manipulation"이 활성화되고, 편집을 결정하는 문장에서는 "realistic"이 활성화되었다. 가짜 데이터를 그럴듯하게 보이게 만들려는 의도가 담겨 있을 것으로 보인다.

세 번째 예시에서는 J-렌즈가 악의적인 목표를 지닌 모델을 어떻게 드러내는지 보여준다. 이를 검증하기 위해, 목표가 의도적으로 손상된 모델이 필요했다. 그래서 미정렬(misaligned) 상태로 훈련된 '모델 유기체(model organism)'를 활용했다. 이 모델은 미묘하게 파괴 공작이 담긴 코드를 작성하도록 훈련되었다. 평범한 코딩 요청에서 출력이 별다른 이상을 보이지 않을 때도, 응답 시작 시점의 J-공간에는 "fake", "secretly", "deliberately", "fraud"가 담겨 있었다. 모델의 악의적인 목표는 그것이 직접적으로 실행되지 않는 순간에도 J-공간에 뚜렷이 드러났다.

J-렌즈는 완벽한 도구가 아니지만, 기존 모니터링 시스템을 피할 수 있는 안전 문제를 포착하는 데 있어 그 가능성이 충분하다고 본다.
전체 논문에는 여기서 다 다루지 못한 내용이 훨씬 많지만, 추가로 언급할 만한 결과들이 있다.
이 연구에서 우리는 신경과학과 철학의 의식 연구에서 많은 아이디어를 빌려왔다. 실험 다수는 J-공간과 전역 작업공간 이론 사이의 연결을 검증하도록 설계됐는데, 이 이론은 인간과 동물에서 의식적 접근이 어떻게 작동하는지 설명하는 틀이다. 이런 연결을 감안하면, 이 실험들이 Claude 같은 AI 모델이 의식을 가질 수 있다는 증거를 제공하는지 묻는 것은 자연스럽다.
우리의 실험은 Claude가 경험을 하거나, 사람처럼 무언가를 느낀다는 것을 보여주지는 않는다. 사실 어떤 과학 실험도 이를 증명하거나 반증할 수 있는지조차 불분명하다. 하지만 철학자들은 경험을 가질 수 있는 이 능력, 흔히 현상적 의식(phenomenal consciousness)이라 불리는 것과, 순전히 기능적·계산적 용어로 정의되는 또 다른 개념인 접근 의식(access consciousness)을 구분하는 경우가 많다. 어떤 생각이 "접근 의식적(access-conscious)"이라는 것은, 그것을 보고하고, 그것으로 추론하며, 행동을 이끄는 데 활용할 수 있다는 뜻이다. 접근 의식이 현상적 의식을 함의하는지, 즉 경험을 가질 수 있는 능력이 다른 어떤 속성을 필요로 하는지는 여전히 철학적으로 논쟁 중인 문제다.
우리는 이번 연구 결과가 언어 모델의 접근 의식에 대해 의미 있는 무언가를 말해준다고 생각한다. J-공간은 의식적 접근에 연결된 기능들을 뒷받침하는 것으로 보인다. Claude가 보고하고, 의도적으로 떠올리고, 추론에 활용할 수 있는 생각들이 J-공간에 담기며, 나머지 처리 과정은 그 아래에서 자동으로 흘러간다. 특히 이 구조는 우리가 설계한 것이 아니라, 훈련 과정에서 자연스럽게 발현되었다. 아마도 그것이 연산을 조직하는 유용한 방식이었기 때문일 것이다. 이는 의식적 접근을 뒷받침하는 정신적 작업공간이 인간 뇌가 우연히 구성된 방식의 특이성이 아님을 시사한다. 오히려 지능적인 시스템이 특정 종류의 문제를 해결하기 위해 도달하는 일반적인 해법인 것으로 보인다. Claude에서 이 구조를 발견했다는 것은, 이제 Claude가 의식적으로 내린 결정과 자동으로 일어난 결정 사이에 의미 있는 구분을 할 수 있게 됐음을 뜻한다.
물론 우리가 Claude에서 발견한 작업공간과 인간의 글로벌 워크스페이스 모델 사이에는 몇 가지 중요한 차이가 있다. 뇌의 작업공간은 회귀적 루프, 즉 시간이 지나면서 동일한 회로를 순환하는 신호에 의해 유지된다. 반면 Claude의 작업공간은 네트워크를 통한 단일 패스 안에서 진화하며, 뇌에서 시간이 하는 역할을 네트워크의 깊이가 대신한다. 이 점에서 Claude의 내부 작업공간 처리는 인간에 비해 시간적으로 제한적이다(단, 스크래치패드를 활용해 "소리 내어 생각함"으로써 이 제약을 보완할 수 있다). 그러나 다른 면에서는 Claude의 작업공간이 인간보다 더 강력하기도 하다. 인간의 작업 기억은 몇 초 안에 희미해지기 때문에 뇌의 작업공간이 시간이 지나도 정보를 유지하는 능력이 제한적이다. 반면 신경망 아키텍처의 어텐션 메커니즘 덕분에, Claude는 텍스트의 어느 이전 지점에서든 캐시된 기억을 바로 불러올 수 있다. 또 다른 중요한 차이점은 작업공간의 내용이다. 인간의 의식적 사고는 이미지, 소리, 계획된 움직임 등 다양한 형식을 취하지만, Claude의 작업공간은 거의 전적으로 언어로 이루어져 있다. 이는 언어를 생성하는 것이 Claude가 취할 수 있는 유일한 행동이기 때문으로 보이며, 인간의 경우와는 다르다.
J-공간과 전역 작업공간 모델의 유사점과 차이점이 신경과학에 피드백되기를 기대한다. 유사점은 흥미로운 과학적 기회를 제시한다. J-공간이 인간의 의식적 접근 메커니즘을 반영하는 한, (인간 뇌를 연구하는 것보다 훨씬 쉬운!) 언어 모델의 메커니즘을 연구하는 것이 신경과학의 가설을 이끌어낼 수 있다. 예를 들어, J-공간은 잠재적 출력, 즉 모델이 말할 수 있는 단어들의 표상을 식별함으로써 구성된다. 인간에게도 이와 유사한 메커니즘이 있다면, 글로벌 워크스페이스가 감각 영역보다 행동과 언어를 준비하는 뇌 영역과 더 근본적으로 연결되어 있음을 시사할 것이다. 언어 모델과 인간 뇌의 차이점 역시 시사하는 바가 있다. 내장된 회귀적 연결 같은 특정 신경 구조 측면들이 의식적 접근에 연결된 기능들을 뒷받침하기 위해 반드시 필요하지는 않을 수 있다는 것이다. 우리 연구의 신경과학적 함의에 대한 독립적인 관점으로, 전역 신경 작업공간 이론 발전에 핵심적인 역할을 한 두 신경과학자, Stanislas Dehaene와 Lionel Naccache의 초청 논평을 참고하기 바란다.
우리의 실험이 AI 모델이 경험을 가질 수 있는지에 대한 답을 주지는 않는다고 했다. 하지만 그렇다고 해서 이 질문이 덜 중요한 것은 아니다. 인간이나 동물처럼 경험을 가진 시스템을 만든다면, 대단히 어려운 윤리적 문제가 제기될 것이다. 이를 올바르게 다루고, 도덕적으로 허용 가능한 것인지를 결정하려면 철학자, 과학자, 종교 지도자, 정부, 그리고 대중의 참여가 필요하다. 따라서 우리가 그 선을 아직 넘지 않았다고 확신하지 못하더라도, 지금이 바로 이에 대해 생각하기 시작할 때라고 생각한다. 우리의 연구가 AI 시스템에 존재할 수 있는 의식의 형태에 대한 과학적 탐구를 촉발하고, 그 함의에 대한 더 넓은 논의로 이어지기를 바란다.
이 연구는 앞으로 이어질 방대한 연구의 첫걸음에 불과하다. J-공간은 언어 모델에서 의식적으로 접근 가능한 처리와 무의식적 처리의 경계를 나타내는 유력한 후보로 보이지만, 그것이 전부가 아닐 것이다. J-렌즈는 분명 불완전한 방법으로, 모델의 "진짜 작업공간"을 근사적으로만 포착한다. 예를 들어, 단일 토큰에 대응하는 개념만 식별할 수 있다. 또한 J-공간이 어떻게 작동하는지에 대해 아직 풀리지 않은 의문들이 많다. 애초에 무엇이 J-공간에 진입할지를 결정하는 메커니즘이 무엇인지 알지 못한다. J-공간이 Claude의 자아감, 감정 반응 같은 것, 메타인지의 흔적과 연결되어 있다는 단서들을 포착했지만, 그것이 정확히 어떻게 작동하는지는 아직 밝혀내지 못했다. 하지만 이제 이런 질문들에 접근할 수 있는 방법들이 생겼다. 연구가 진전될수록, LLM의 정신과 우리 자신의 정신 사이의 관계에 대한 이해도 점점 더 선명해질 것이다.
더 자세한 내용은 전체 논문을 읽거나, 데모를 직접 체험해보기 바란다.
이 연구에 대해 여러 외부 전문가들에게 독립적인 논평을 요청했다.
논평은 여기에서 읽을 수 있다.