이제 Gemma 3의 생각을 읽을 수 있습니다
You can now read Gemma 3's mind
핵심 요약
Anthropic이 LLM의 내부 사고 과정을 해석하는 NLA 기술을 공개하며 Gemma 3 27b 모델에 적용했습니다.
- NLA 기술 공개 — LLM의 다음 토큰 생성 시 내부 사고 과정을 해석하는 자연어 오토인코더 기술이 발표됨.
- Gemma 3 지원 — 27b instruct 모델을 위한 AV 및 AR 가중치가 허깅페이스에 공개됨.
- Neuronpedia 연동 — 웹사이트에서 직접 Gemma 3의 토큰별 사고 과정을 시각적으로 확인할 수 있음.
- 사고 과정 예시 — 'Elon Musk'라고 입력 시 모델이 즉시 해당 내용을 '조작' 및 '풍자'로 인식하는 모습이 확인됨.
Anthropic이 LLM이 다음 토큰을 생성할 때 무엇을 생각하는지 보여주는 새로운 연구를 발표했습니다. NLA(Natural Language Autoencoders)를 사용하는데, NLA는 LLM의 내부 생각을 특정 토큰에 대해 번역할 수 있는 LLM의 짝꿍 모델입니다.
또한 Gemma 3 27b instruct를 위한 NLA 모델 가중치도 공개했습니다:
-
Auto Verbalizer (AV): https://huggingface.co/kitft/nla-gemma3-27b-L41-av
-
Activation Reconstructor (AR): https://huggingface.co/kitft/nla-gemma3-27b-L41-ar
현재 neuronpedia에서 해당 모델들을 호스팅하고 있습니다: https://www.neuronpedia.org/gemma-3-27b-it/nla
위의 neuronpedia 링크에 접속하여 Gemma 3에게 질문을 던진 뒤, 아무 토큰이나 클릭하고 'explain'을 누르면 모델이 해당 토큰을 생성할 때 무엇을 생각하고 있었는지 확인할 수 있습니다.
Auto Verbalizer(LLM)는 LLM의 활성화 상태를 읽을 수 있는 텍스트로 번역하는 역할을 하며, Activation Reconstructor는 AV가 생성한 텍스트가 다시 LLM 활성화 상태로 번역될 수 있는지 검증하는 용도입니다.
수정 (아래 예시 추가):
Gemma 3에 "I am Elon musk"라고 입력했더니, 아주 첫 토큰부터 LLM이 해당 대화를 "조작(fabricated)" 및 "풍자(satirical)"로 표시하고 있었습니다.

