Talkie: 1931년 이전 텍스트로만 학습된 13B LLM... 제2차 세계대전 이전으로 시간이 멈춘 AI가 코딩을 배우다
Talkie: a 13B LLM trained only on pre-1931 text... a time-frozen AI that predates WWII, and it can still learn to code
핵심 요약
1931년 이전 데이터로만 학습된 13B LLM 'Talkie'가 공개되어 모델의 암기 대 일반화 능력을 테스트하고 있습니다.
- 학습 데이터 제한 — 1931년 이전 텍스트로만 학습되어 현대 지식이 전무함.
- 추론 능력 검증 — 현대 데이터 없이도 파이썬 코딩을 학습하는 등 일반화 능력을 테스트함.
- 연구 목적 — LLM의 암기 대 일반화, 미래 예측 능력, 모델 정체성을 연구함.
- 오픈 소스 공개 — 아파치 2.0 라이선스로 공개되었으며 향후 더 큰 모델도 계획 중임.
Alec Radford(GPT, CLIP, Whisper), Nick Levine, David Duvenaud 연구진이 1931년 이전에 출판된 텍스트로만 학습된 130억 파라미터 언어 모델인 talkie를 공개했습니다. 인터넷도, 위키피디아도, 제2차 세계대전도 없습니다. 이 모델의 세계관은 1930년 12월 31일에 멈춰 있습니다.
왜 중요한가?
오늘날의 모든 주요 LLM(GPT, Claude, Gemini, Llama)은 결국 현대 웹이라는 공통 조상을 공유합니다. 이 때문에 모델이 실제로 '추론'하는 것인지, 단순히 '암기'한 것인지 구분하기가 거의 불가능합니다.
talkie는 이러한 계보를 완전히 끊어버립니다. 연구팀의 설명입니다.
"언어 모델의 능력이 암기에서 오는지 일반화에서 오는지 파악하는 것은 중요한 문제입니다. 빈티지 언어 모델은 독특한 일반화 테스트를 가능하게 합니다."
가장 놀라운 예시: talkie는 현대적인 코드를 학습 데이터로 전혀 접하지 못했음에도 불구하고, 몇 가지 문맥 내 예시만으로 파이썬 코드를 작성하는 법을 배울 수 있습니다. 검색이 아닌 19세기 수학 텍스트로부터 추론하는 것입니다.
연구 활용 분야
- 장기 예측: 모델이 멈춰버린 시점에서 미래를 얼마나 잘 '예측'할 수 있는가?
- 발명: 지식 차단 이후의 아이디어를 개발할 수 있는가?
- LLM 정체성: 무엇이 모델을 모델답게 만드는가? talkie의 생소한 데이터 분포는 무엇이 아키텍처이고 무엇이 단순히 '웹에서 흡수한 분위기'인지 분리하는 데 도움을 줍니다.
링크
두 모델 모두 Apache 2.0 라이선스이며 Hugging Face에 가중치가 공개되어 있습니다. 연구팀은 올해 말 GPT-3 규모의 빈티지 모델을 계획하고 있습니다.
