업데이트 #2: yandex/AliceAI-80B-A3B [instruct!] 모델 사후 학습 진행 상황
Update #2: Post training yandex/AliceAI-80B-A3B [instruct!] from scratch
핵심 요약
yandex/AliceAI-80B-A3B 모델의 instruct 파인튜닝 진행 상황을 공유하고 향후 GGUF 배포 및 추가 학습 계획을 발표했습니다.
- 모델 학습 — 합성 데이터셋을 활용한 instruct 파인튜닝 진행 중임.
- 학습 방식 — QLoRA 어댑터를 사용해 어텐션과 공유 전문가 레이어만 학습함.
- 향후 계획 — GGUF 양자화 버전 배포 및 강화 학습을 통한 추가 학습 예정임.
- 기술 공유 — 학습용 커스텀 커널 및 증류 엔진 오픈소스화 진행함.
최종 업데이트: https://www.reddit.com/r/LocalLLaMA/comments/1wu9ksu/update_yandexaliceai_80ba3b_fine_tune_progress/ - 기본 모델에 합성 증류 데이터셋을 사용해서 인스트럭트 파인튜닝을 돌린 거임. 그동안 계속 업데이트 올렸으니까 본 사람들도 좀 있을 듯.
라이브 스트림: https://figure-bios-expect-cio.trycloudflare.com/
48시간 동안 윙윙거리면서 돌아가던 초기 학습이 드디어 거의 다 끝났다. 로스 커브가 좀 미쳐 날뛰는 것처럼 보이긴 하는데, 분석도 좀 해보고 LLM이랑 대화도 나눠보니까 에포크마다 평균 로스는 꾸준히 줄어들고 있더라(로스 커브가 이상하게 보이는 건 보캐불러리 사이즈나 에포크별 토큰 수 차이 같은 이유 때문임). 암튼 지금까지 나오는 결과물은 꽤 만족스러움.
어텐션이랑 공유 익스퍼트(shared expert) 쪽만 추가 학습시키고 베이스 익스퍼트는 그대로 얼려뒀음. 이건 원래 얀덱스 학습 데이터를 그대로 유지하면서 행동이랑 논리 쪽만 파인튜닝하는 방식임.
며칠 내로 GGUF 양자화 버전 몇 개랑 로컬에서 돌릴 수 있는 llama.cpp 패치까지 같이 공개할 생각임. 초기 파인튜닝이 얼마나 잘 먹힐지는 아직 모르겠음. 로스는 괜찮아 보이는데 직접 평가를 좀 해봐야지. 어쨌든 QLoRA 어댑터에 용량도 널널하게 남았으니까 강화 학습이랑 SFT 데이터셋 더 늘려서 계속 학습시킬 계획임. DeepSeek가 했던 것처럼 일단 이 버전도 퍼블릭 체크포인트로 풀 테니까 다들 가지고 놀아보고 다음 체크포인트도 기대해주면 좋겠음.
다들 즐겁게 해보자고! 계속 지켜봐 줘. 이 정도 사이즈 모델이 가지고 놀기 딱 재밌거든. 인스트럭트 버전 빨리 공개하고 싶네. 너희가 원하면 뭐든 오픈소스로 풀 생각임. 증류 엔진은 이미 오픈소스(며칠 전에 여기 올라온 SFTMill 참고)로 풀었고, V100에서 이거 돌리려고 만든 커스텀 커널이랑 다른 패치들도 공유 가능함(이거 학습시키느라 32GB V100 3개로 며칠 동안 빡세게 돌렸는데, 세팅 잡느라 진짜 고생했다). 마지막으로 내 홍보 좀 하자면, 혹시 원격이나 뉴욕에서 개발자나 ML 엔지니어 뽑는 곳 있으면 나한테 연락 좀 줘!

