J-space 논문은 앤스로픽이 최근 내놓은 것 중 최고임. 클로드 가중치는 비공개라 오픈 모델용 실시간 뷰어를 직접 만들었음
the J-space paper is the best thing anthropic has shipped in a while. claude’s weights are closed so i built the live viewer for an open model instead
핵심 요약
앤스로픽의 J-space 연구를 활용해 오픈 소스 모델용 실시간 사고 과정 뷰어를 개발한 사례입니다.
- J-space 연구 — 모델 내부의 잠재적 사고 공간을 시각화함
- 실시간 뷰어 개발 — 클로드 대신 Qwen 모델을 활용해 사고 과정을 구현함
- 사고 과정 관찰 — 모델이 답변 전 연산을 계획하는 모습을 실시간으로 확인 가능
- 범용적 현상 — 트랜스포머 모델이라면 어디서든 나타나는 보편적 특성임
아직 안 읽어봤다면 꼭 읽어보길: https://www.anthropic.com/research/global-workspace. 클로드에는 모델이 보고하고, 조종하고, 추론할 수 있는 침묵의 단어들로 이루어진 창발적 내부 작업 공간이 있음. 나를 놀라게 한 건 안전성 섹션이었는데, 렌즈가 모델이 블랙메일 평가 중에 겉으로는 동조하면서도 속으로는 “가짜”, “허구”라고 생각하는 걸 포착했고, 조작을 시도하는 행에서는 정확히 “조작”이라는 단어를 잡아냈음. 모델은 다 알고 있음. 지금 바로 읽어볼 수 있음.
레포: https://github.com/ninjahawk/Subtext
오늘 클로드 코드를 써서 전체를 다 만들었음. 내가 UI에 집중하는 동안 클로드가 렌즈 로딩이랑 토큰별 판독 후크를 작성해 줬음. bf16 스트리밍 경로랑 앤스로픽의 레퍼런스 구현을 검증하는 감사 스크립트는 사실상 페어 프로그래밍으로 짰음. 혼자 했으면 몇 주 걸렸을 텐데, jacobian-lens 레포를 가리키면서 피팅 코드를 직접 추론하게 할 수 있었다는 점이 이 프로젝트를 가능하게 만든 핵심이었음.
앤스로픽이 렌즈를 오픈 소스로 풀었고 뉴런피디아(Neuronpedia)가 Qwen용으로 미리 피팅된 렌즈를 공개했길래, 그걸 채팅 인터페이스에 연결했음. 토큰당 9개 레이어의 판독값을 실시간으로 렌더링함. 레포에 데모 영상도 있음: 답변이 시작되기 전에 모델이 12+5=1이라는 결론을 내리는 모습, 그리고 모듈러 연산이나 비트 연산을 말하기 전에 미리 머릿속에 담아두는 모습(모듈러 산술 주의 사항을 계획하고 있었던 거임. 모델이 계획하는 걸 직접 볼 수 있음).
그리고 맞음, 클로드가 아니라 Qwen임. 가중치가 닫혀 있어서 클로드로는 어쩔 수 없음. 하지만 솔직히 그게 더 흥미로운 부분임. 논문의 현상이 무작위 오픈 소스 4B 모델에서도 재현되거든. 이 작업 공간은 클로드만의 전유물이 아니라, 트랜스포머를 학습시키면 어디서든 나타나는 현상임.
¯*(ツ)*/¯


