WVY는 수작업으로 만든 언어 모델입니다. 지능의 환상이 매개변수 수에만 국한되지 않음을 증명하기 위해 모든 응답을 한 사람이 직접 작성했습니다.
WVY is a handwritten language model. Every response was written by one person to demonstrate that the illusion of intelligence is not exclusive to parameter count.
핵심 요약
한 사람이 모든 응답을 직접 작성한 소규모 언어 모델을 통해 지능의 환상을 실험하는 프로젝트입니다.
- 수작업 데이터셋 — 모델의 모든 응답을 한 사람이 직접 작성하여 지능의 환상을 실험함
- 소규모 모델 연구 — 43M 매개변수 모델을 활용해 데이터 효율성과 지능의 본질을 탐구함
- 실험 목적 — 대규모 데이터 없이도 AI가 출력물을 생성할 수 있음을 증명하려 함
- 오픈 소스 예정 — 데이터셋과 모델을 곧 공개하여 투명한 연구 과정을 공유할 계획임
이 스크린샷은 데이터셋을 처음부터 직접 만들려고 제가 만든 앱 화면입니다. 모델이랑 실제로 대화하는 거 아니니까 오해 ㄴㄴ
일단 우리 작업물 직접 테스트해 준 형들 다들 고맙다.. 43m 파라미터 모델 다운로드 500회 넘게 찍혔더라. 이제 연구 목적으로 더 가볍게 만드는 거 도전 중임.
나 파인튜닝 예제도 짜고 언어 모델 개발한 지 좀 됐는데.. 보통 다들 방대한 데이터셋으로 사전 학습(pretrain) 돌려놓고 데이터 속에 의미가 알아서 생기길 기도하잖아? 근데 우리는 의도적으로 하나하나 깎아서 만드는 중임. 지금 컴퓨터 앞에 앉아서 이 새 모델이 입력값에 대해 내뱉을 모든 응답을 내가 직접 다 쓰고 있다. 그래야 모델이 어떻게 변하는지, 내부에서 정확히 무슨 일이 일어나는지 다 볼 수 있으니까. 곧 공개할 예정임. 데이터셋은 의도적으로 엄청 작게 만들어서 응답 설계하는 거 금방 끝날 듯.
일반 기능:
-
토큰 예측이 어떻게 돌아가는지 설명
-
자기 자신 외에는 아무것도 이해 못 한다는 사실을 설명
-
짧은 대화
코딩 기능:
-
1부터 10까지 세는 루프 작성
-
사용자가 보낸 코드를 이해할 수 없다는 사실을 설명
오픈 소스 곧 공개 예정


