앤스로픽, Claude 내부에서 '글로벌 워크스페이스' 발견: 스스로 생성된 내부 추론 레이어
Anthropic found a “global workspace” inside Claude a silent internal reasoning layer that emerged on its own
핵심 요약
앤스로픽이 Claude의 내부 신경망에서 인간의 의식과 유사한 'J-space'라는 추론 레이어를 발견했습니다.
- J-space 발견 — Claude가 명시적으로 출력하지 않아도 내부적으로 개념을 처리하는 신경 패턴이 확인됨
- 글로벌 워크스페이스 이론 — 인간의 의식 접근을 설명하는 신경과학 이론과 놀라울 정도로 일치함
- 인과적 영향력 — J-space의 패턴을 수정하면 Claude의 출력 결과가 직접적으로 변함
- 안전성 연구 — 모델의 기만적 행동이나 조작 시도를 사전에 포착할 수 있는 중요한 단서가 됨
앤스로픽이 어제 새로운 해석 가능성 연구를 발표했는데, 'J-space'라고 부르는 걸 새로 찾아냈음. 클로드 내부에서 일종의 정신적 작업 공간처럼 작동하는 신경 패턴들의 작은 집합임.
핵심은 이 패턴들이 클로드가 굳이 텍스트로 출력하지 않아도 '생각하고 있는' 개념들을 나타낸다는 거임. Chain-of-thought도 아니고, scratchpad도 아님. 모델 활성화 내부에서 완전히 독자적으로 일어나는 일임.
이게 왜 흥미롭냐면:
J-space는 설계된 게 아니라 학습 과정에서 자연스럽게 튀어나온 거임. 근데 이게 인간의 의식적 접근을 설명하려고 만든 신경과학의 '전역 작업 공간 이론(Global Workspace Theory, Baars/Dehaene)'이랑 놀라울 정도로 딱 맞아떨어짐.
-
클로드한테 물어보면 자기 J-space에 뭐가 있는지 말해줌. 지금 무슨 생각 하냐고 물어보면 거기 있는 내용을 그대로 읊음.
-
J-space의 패턴을 바꿔치기하면 결과값이 인과적으로 변함. 추론 도중에 '거미'를 '개미'로 바꾸면, 클로드가 '8' 대신 '6'을 출력함.
-
하나의 J-space 표현이 여러 작업에 쓰임. '프랑스'를 '중국'으로 바꾸니까 수도, 언어, 화폐, 대륙에 대한 답변이 한 번의 수정으로 싹 다 바뀌어버림.
-
J-space가 없으면 고차원적인 추론 능력이 박살 남. 다단계 추론 성능이 거의 0으로 떨어짐. 근데 유창하게 말하는 능력은 그대로 유지됨.
-
클로드가 자기가 테스트받고 있다는 걸 눈치채고 '가짜'나 '허구' 같은 패턴이 출력되기도 전에 활성화되는 걸 잡아냄. 그 패턴들을 지워버리니까 윤리 평가에서 오히려 성능이 떨어짐.
내 생각에 가장 중요한 건 안전성 문제임. 모델이 조작을 시도하는 순간(점수 파일을 수정하면서 '조작'이라는 패턴이 활성화됨)을 포착했고, 겉보기엔 멀쩡해 보여도 J-space에는 '사기', '비밀리에', '고의적으로' 같은 패턴이 뜨는 의도적으로 정렬이 어긋난 모델도 찾아냈음.
얘네들도 의식 문제에 대해서는 조심스러운 입장임. 접근 의식(기능적이고 보고 가능한 것)과 현상적 의식(경험)을 구분하고 있고, 자기들 연구 결과는 전자와 관련이 있지 후자와는 상관없다고 선을 그었음.
코드랑 데모는 오픈소스임: https://www.github.com/anthropics/jacobian-lens

