4개국 14대의 Mac을 활용한 RL 사후 학습
RL post-training on 14 Macs across 4 countries
핵심 요약
4개국에 흩어진 14대의 Mac을 활용해 분산 환경에서 RL 사후 학습을 성공적으로 수행한 사례입니다.
- 분산 RL 학습 — 4개국 14대의 Mac을 활용해 추론을 분산 처리함.
- 효율적 동기화 — PULSE와 DPPO 확률 게이트를 통해 데이터 전송량과 오차를 최소화함.
- 성능 향상 — PaperSearchQA 작업에서 검색 성공률과 정확도가 크게 개선됨.
- 오픈 소스 지향 — 개인 소유 하드웨어를 활용해 모델 학습의 개방성을 유지하고자 함.
공개: 저는 이걸 만든 연구소인 Pluralis Research에서 일합니다. 코드는 오픈 소스고, 궁금한 거 있으면 뭐든 물어보세요.
세 줄 요약: 우리가 아는 한, 이게 일반 소비자용 Mac들을 인터넷으로 연결해서 전체 롤아웃(rollout)을 돌린 첫 번째 RL 포스트 트레이닝 사례임.
셋업
4개국에 흩어진 Mac 14대가 모든 롤아웃을 생성했음. 각 기기는 MLX로 int8 추론을 돌렸고, 지구 반대편에 있는 B200 한 대가 bf16 그래디언트 업데이트를 처리함.
이놈들은 그냥 일반 가정용 인터넷이랑 Cloudflare R2로만 데이터를 주고받았음. 데이터센터용 전용 회선 같은 건 없었음. 내 맥북 하나도 거기 포함돼 있었고.
이게 왜 중요하냐면, 에이전트 RL에서 롤아웃 생성하는 데 들어가는 연산량이 전체의 80% 정도를 차지하기 때문임.
어려운 부분
진짜 골 때리는 건 Mac에서 토큰 뽑아내는 게 아니었음. bf16 Megatron 트레이너(B200)는 몇 버전 지난, int8로 양자화된, 게다가 다른 커널 스택에서 돌아가는 가중치로 만든 롤아웃을 받아먹어야 했거든.
이 오프 폴리시(off-policy) 간극을 메우기 위해 두 가지를 썼음:
- PULSE: 전체 체크포인트 대신 int8 가중치 델타값만 보냄. 버전 간에 int8 값의 0.5% 정도만 바뀌니까, 보통 9GB씩 보내야 할 걸 82MB 정도로 줄일 수 있었음.
- DPPO 스타일 확률 게이트: 롤아웃 모델이랑 트레이너 사이에서 확률값이 너무 튀는 토큰들(전체의 0.3% 정도)을 걸러냄.
결과
우리는 다중 턴 생물의학 검색 태스크인 PaperSearchQA로 Stoa를 테스트했음.
전체 검증 세트에서 cover pass@1은 29%에서 63%로, 검색 성공률은 22%에서 84%로 떡상함.
결국 툴 쓰는 법을 제대로 배운 거지.
한계와 방향성
현재 Stoa는 모델이 Mac 한 대에 다 들어가야 하고, 트레이너도 클러스터 하나로 제한됨.
최근 Pluralis의 Agora가 수백 대의 소비자용 GPU를 인터넷으로 묶어서 파이프라인 병렬화로 Pluralis-8B 사전 학습을 끝냈음. Agora랑 Stoa를 합치면 거대 모델 추론이랑 학습을 전부 분산된 소비자용 하드웨어 위에서 돌릴 수 있게 될 거임.
전 세계에 놀고 있는 소비자용 컴퓨팅 자원을 다 합치면 지금 최첨단 모델 돌리는 클러스터들 다 합친 것보다 큼. 최고의 모델들이 점점 폐쇄형 API 뒤로 숨는 상황에서, 사람들이 이미 가지고 있는 하드웨어로, 직접 모델을 학습시키는 게 모델을 계속 오픈 상태로 유지할 수 있는 방법 중 하나임.
코드: https://github.com/PluralisResearch/stoa
전체 글: https://pluralis.ai/blog/rl-post-training-on-macs
X 스레드:



