Bart: 빈티지 LLM
Bart: A vintage llm
핵심 요약
1931년 이전의 영어 텍스트로만 학습시킨 2.82B 파라미터 규모의 빈티지 LLM 'Bart'가 공개되었습니다.
- 빈티지 LLM 개발 — 1931년 이전 텍스트 20.1B 토큰으로 학습된 2.82B 파라미터 모델임
- 오픈 소스 공개 — 데이터셋, 학습 코드, 평가 도구 등 모든 자료를 공개함
- 이름 논란 — 기존의 유명 모델인 BART와 이름이 겹쳐 혼동을 야기함
- 데이터 오염 의혹 — 학습 데이터에 현대적 내용이 섞여 있다는 의심이 제기됨
3개월 동안 800달러를 꼴아박은 끝에...
Unbounded Labs에서 우리의 빈티지 LLM인 Bart를 소개한다. 1931년 이전에 작성된 영어 텍스트 20.1B 토큰으로 밑바닥부터 학습시킨 2.82B 파라미터 모델이다. 지금 바로 대화해 볼 수 있다!
데모: https://www.unboundedlab.com/chat/bart
제작 과정에 관한 글: https://www.unboundedlab.com/blog/bart
Huggingface: https://huggingface.co/jbduran/bart-sft
도대체 왜 빈티지 LLM을 만드냐고? 데미스 허사비스가 제안했듯이, LLM이 과거 위대한 과학자들과 같은 결론에 도달할 수 있을까? 일반 상대성 이론까지는 예산 문제로 무리였지만, 우리는 이 분야를 발전시키는 게 AI 연구의 핵심을 찌르는 길이라고 믿는다. 이 모델들이 독창적인 아이디어를 낼 수 있을까, 아니면 그냥 다음 토큰이나 뱉어내는 기계일 뿐일까?
이 글은 우리가 코퍼스를 어디서 가져왔고 어떻게 정제했는지, 기존에 없던 벤치마크를 어떻게 직접 만들었는지, 모든 어블레이션(ablation), 학습 과정, 사후 학습, 그리고 그 과정에서 저지른 실수까지 전부 담은 기록이다.
"내가 만들 수 없는 것은 이해할 수 없다"는 리처드 파인만의 말을 정말 좋아한다. Bart를 만든 건 LLM에 대해 읽기만 하는 게 아니라 실제로 이해해 보려는 우리의 시도였다.
우리가 가장 자랑스럽게 생각하는 것들:
- Vintage CORE 기준, 해당 규모에서 최고의 빈티지 베이스 모델. 더 적은 토큰 예산으로 GPT-1900을 앞질렀음
- 가장 큰 빈티지 데이터셋 중 하나인 하버드 기관 도서(Harvard's Institutional Books) 정제 (242B->23B 토큰)
- 빈티지 LLM을 위한 최초의 20개 벤치마크 세트, Vintage CORE 제작
- H100 한 대로 10시간 동안 자율 연구 수행: 100번의 실험, 26개의 개선점 발견
- 우리가 아는 한 가장 큰 빈티지 SFT 데이터셋 공개: 1930년대 이전 텍스트를 기반으로 한 416k개의 등급별 질의응답 쌍
- H100에서 5일 만에 최종 모델 학습 완료, 전체 과정에서 60% MFU 유지
- 모든 데이터셋, 방법론, 학습 코드, 평가 및 학습 기록 오픈 소스로 공개
우리 팀이 정말 자랑스럽다. 우리가 만든 건 빈티지 LLM 분야를 한 단계 끌어올릴 것이고, 연구자로서 그리고 인간으로서 우리 자신도 성장하게 만들었다.
이 모든 비용은 우리가 직접 댔고, 지금까지 약 807달러가 들었다. 돈이 우리와 더 큰 규모의 학습 사이를 가로막는 가장 큰 장벽이다.
그래서 대놓고 요청한다. 우리의 미래를 위해 컴퓨팅 지원, 자금, 그리고 멘토를 찾고 있다. 사전 학습이나 사후 학습 쪽에서 일하거나, 놀고 있는 GPU가 있다면 우리랑 얘기 좀 하자!
우리는 꼼꼼한 데이터셋 큐레이션, 도메인 전문 지식, 그리고 고효율 학습을 통해 중요한 분야에서 SOTA(최첨단) 결과를 낼 수 있다고 믿는다. 이건 Unbounded Labs의 시작일 뿐이다. 우리는 앞길에 한계가 없다고 본다.


