자기회귀 LLM은 이제 끝장났다 (얀 르쿤의 말이 맞았다)
Auto-regressive LLMs are officially sleeping with the fishes (Yann LeCun was right)
핵심 요약
LLM은 패턴 인식에는 뛰어나지만, 진정한 이해를 위해서는 신체화된 세계 모델이 필수적이라는 분석.
- 범용성 증명 — LLM 아키텍처가 고래의 클릭음을 해석하며 패턴 인식의 범용성을 입증함.
- 기호 접지 문제 — 통계적 패턴 매칭만으로는 의미를 이해하는 진정한 지능에 도달할 수 없음.
- 신체화된 세계 모델 — AGI 구현을 위해서는 텍스트를 넘어 물리적 현실과 연결된 다중 모달 학습이 필요함.
- 생물학적 효율성 — 방대한 데이터를 학습하는 LLM과 달리, 생물은 적은 데이터로도 복잡한 언어를 습득함.
세 줄 요약: LLM 아키텍처를 고래의 클릭음에 적용한 결과, AI가 외계의 문법을 이해할 수 있음이 증명되었으나, 동시에 현재 AI가 근본적으로 정체된 이유도 드러남. AGI는 물리적 신체화, 다중 모달 인식, 그리고 인간 중심적 벤치마크에서 벗어나는 큰 도약이 필요함.
Project CETI(고래류 번역 이니셔티브)는 LLM의 기반이 되는 머신러닝 아키텍처를 사용하여 '향유고래 음성 알파벳'을 밝혀냈음. 가장 진보된 AI를 인간이 아닌 종에게 적용한 것은 AI 자신을 비추는 심오한 거울이 되었음.
고래와 대화하려는 시도는 AGI를 향한 여정에 대해 무엇을 말해주는가?
트랜스포머는 범용적이다: 인간의 텍스트를 위해 설계된 AI 모델이 해양 포유류의 클릭음을 성공적으로 해석했음. 이는 현대 신경망 시스템이 범용 시퀀스 디코더임을 증명함. 본질적으로 우리는 지능의 '패턴 찾기' 계층을 해결한 것임.
'기호 접지(Symbol Grounding)' 문제: AI는 고래의 다음 클릭음(문법)을 꽤 잘 예측하지만, 그것이 무엇을 의미하는지(의미론)는 전혀 알지 못함. 이는 통계적 패턴 매칭이 신체와 분리되어 있으며, 진정한 이해와는 같지 않음을 증명함.
AGI는 신체화된 '세계 모델'이 필요하다: 향유고래는 소나를 사용하여 환경을 '보고' 동시에 '말함'. 문법과 의미 사이의 간극을 메우기 위해 과학자들은 클릭음을 물리적 상태 및 움직임 데이터와 연관시켜야 함. 이는 AGI가 단순히 텍스트를 확장하는 것만으로는 달성될 수 없으며, 공유된 물리적 현실에 기반한 다중 모달리티가 필요하다는 믿음을 강화함.
'외계' 정렬 샌드박스: 고래는 거대한 뇌와 복잡한 사회를 가지고 있으며, 손이나 불이 없는 칠흑 같은 유체 환경에서 살아감. 그들의 의사소통을 해독하는 것은 인류가 인간이 아닌 외계 초지능과 정렬하기 위한 첫 번째 저위험 리허설임.
생물학적 효율성 vs 무차별 대입: LLM은 기본적인 언어 이해를 시뮬레이션하기 위해 인류의 모든 디지털 기록을 필요로 함. 반면 고래 새끼는 훨씬 적은 데이터로도 자기 무리의 복잡한 방언을 학습함. 지속 가능한 AGI를 달성하려면 이러한 생물학적 샘플 효율성을 복제해야 함.
요약: 고래 클릭음을 해독한 것은 현대 AI의 수학적 기반에는 큰 승리이지만, AGI는 단순히 다음 토큰을 예측하는 것에서 마법처럼 나타나지 않을 것이라는 겸허한 교훈을 줌. AGI는 AI가 그 토큰들을 살아있는 다차원적인 세계와 연결하는 법을 배울 때만 실현될 것임.

