새로운 샘플러와 검증기, 0.5B 초소형 모델의 코딩 성능을 획기적으로 개선
New sampler + verifier *drastically* improves tiny 0.5b model coding performance
핵심 요약
0.5B 모델에 검증기를 결합해 성능을 높이는 기술이 소개되었으나, 연산 비용과 VRAM 요구량 증가라는 과제가 남아있습니다.
- 성능 향상 — 0.5B 모델이 2~4B급 모델 수준의 코딩 성능을 발휘함
- 검증기 메커니즘 — 모델이 잘못된 출력을 내면 검증기가 이를 차단하고 재생성하게 함
- 비용 문제 — VRAM 요구량 2배, 연산량 1.5~3배 증가로 인한 속도 저하 발생
- 확장 가능성 — 모델 가중치 변경 없이 검증기 학습만으로 성능 개선 가능
arxiv.org
원문 사이트로 이동
조금 노력해서 읽어봤어.
초소형 모델의 결과는 미쳤어. 이론적으로는 가중치 변경 없이도 0.5B 모델을 코딩 분야에서 2/3/4B급 모델과 동등하게 만들 수 있어. 그리고 대형 모델의 경우, 환각 문제를 30~50% 정도 해결할 수 있을지도 몰라(어디까지나 교육적인 추측이지만).
이게 vLLM이나 SGLang에 들어올 거라 기대하진 마. 하지만 llama.cpp라면 --top-n-sigma처럼 쉽게 통합할 수 있을 거야.
*이제 작은... 아니, 큰 문제가 하나 있어: 이건 백트랙(backtrack) 샘플러라서 모델이 실수하면 다시 돌아가서 재생성해야 하기 때문에 디코드 속도가 자동으로 5~30% 정도 떨어져... 게다가 작은 검증기 모델을 학습시켜야 해... 여기서 작다는 건 원본 모델과 거의 같은 크기를 의미해. 그래서 VRAM 요구량이 두 배가 되고, 메모리 대역폭은 두 배 이상, 연산 요구량은 1.5~3배 정도 증가해. 미안하지만 연구는 여전히 멋지다는 말밖엔 못 하겠네. 더 중요한 건, 이게 더 나은 백트랙 샘플러(이거)가 실제로 LLM의 많은 문제를 해결할 수 있다는 증거라는 거야. 논문이 두어 개 더 나오면 VGB를 엄청나게 빠르게 만들 수 있을지도 모르지. 아니면 AI 연구소들이 논문의 한계를 극복할 방법을 찾아서, 모델과 함께 더 작은 검증기를 공동 학습시키거나.
두 가지 작은 희망적인 부분은:
- 검증기 모델은 동일한 가중치 클래스 이하에서 일반화돼. 즉, 30B 모델용 검증기는 동일한 다양성 분포(예: 도메인, 수학 데이터를 봤다면 수학에 일반화되지만, 위키피디아 데이터를 안 봤다면 위키피디아에는 일반화되지 않음)를 가진 데이터를 학습했다면, 30B 이하의 어떤 모델에서도 작동해.
- 검증기를 학습시키는 비용은 전체 사전 학습에 비하면 거의 공짜나 다름없어. 원본 모델을 가져와서 이미 존재하는 PMK 같은 특수 학습 데이터를 사용해 사전 학습 토큰 크기의 ~0.01% 정도만 학습시키면 되거든.


