"뭐 해야 할까?" - 포스트 트레이닝을 고려해보세요
"What should I do?" - consider post-training
핵심 요약
하드웨어 성능을 낭비하는 벤치마크 대신, 실질적인 가치를 창출하는 포스트 트레이닝(SFT/RFT)에 도전해 보라는 제안.
- 포스트 트레이닝 — 단순 추론을 넘어 모델을 특정 목적에 맞게 최적화하는 기술
- 데이터 전략 — 모델 성능을 결정짓는 핵심 요소로 데이터 합성 및 혼합이 중요함
- 하드웨어 활용 — 효율적인 병렬 처리 스택을 구축하여 반복 학습 속도를 높임
- RFT의 잠재력 — 강화 학습을 통한 미세 조정으로 모델의 성능을 극대화하는 새로운 영역
다들 쿨한 하드웨어 새로 장만하고 나서 "이걸로 뭐 하지?"라고 묻는 글들 많이 올리잖아. 보통 달리는 댓글들은 뻔하지. (1) 모델 X 다운받아라, (2) tps 벤치마크 돌려라, (3) 스크린샷 올려라. 난 이게 존나 지루하고 게으른 짓이라고 본다. 그래서 대안으로 '포스트 트레이닝(post-training)'을 제안하려고 함.
배경을 좀 설명하자면, 난 4년째 "포스트 트레이닝 서비스"를 해오고 있음. 처음엔 4090 서버 하나 두고 BERT 스타일 모델들 SFT(지도 미세 조정)해서 클라이언트들 업무 처리해 주는 걸로 시작했지. 챗봇 같은 게 아님. 예를 들면 (a) 환불 빌런인지 판별하기, (b) 기업 스파이 의심되는 마우스 움직임이랑 키 입력 패턴 태깅하기, (c) 영업사원들 실시간으로 고객 성향이랑 니즈 분석 도와주기 같은 거. 이거 다 실제로 내가 돈 꽤나 벌었던(지금도 벌고 있는) 프로젝트들임.
인퍼런스나 돌리는 원숭이들이랑 다르게, 포스트 트레이닝은 절대 만만한 게 아님. 일단 품질이랑 속도 둘 다 잡아야 함. 오탐률 80% 찍으면서 초당 1,000 토큰 뽑아봤자 아무 의미 없거든. 사실 포스트 트레이닝은 실시간성이 필요 없는 경우가 많아서 TPS는 그렇게 안 중요함(물론 실시간이 필요한 경우도 있긴 함). 둘째, 포스트 트레이닝 레시피는 거의 흑마술 수준임. 튜토리얼이나 가이드 같은 건 찾아볼 수도 없고, Claude나 Codex한테 물어봐도 제대로 못 함(내가 해봐서 앎). 근데 수요는 미친 듯이 많음. 이 최근 논문 한번 봐라. 이게 얼마나 흑마술인지 감이 올 거임. 셋째, 데이터 믹스가 핵심임. 클라이언트가 주는 데이터만으로는 부족해서 더 달라고 징징대야 하고, 결국 성능 뽑아내려면 데이터 합성이나 변환 같은 잔머리도 좀 굴려야 함. 넷째, 데이터랑 모델 조합마다 성능이 천차만별임. 예를 들어 Qwen 시리즈는 포스트 트레이닝하기 존나 까다로움. 지식으로 꽉 차 있어서(벤치마크 점수만 높음) 학습이 잘 안 먹힘. 반면에 멍청한 Llama는 포스트 트레이닝하기엔 최고임. 아는 게 별로 없어서 지식을 스펀지처럼 빨아들이거든(물론 기본 지식 없는 건 단점임). 다섯째, 반복(iterate)을 빨리 할수록 최적의 모델을 빨리 찾아서 결과물을 낼 수 있음. 여기서 엔지니어링이랑 배포 능력이 갈리는 거임. 제대로 된 하드웨어 사서 세팅하면 저전력으로 대규모 병렬 포스트 트레이닝 스택을 구축할 수 있고, 이걸로 미친 속도로 반복 작업이 가능함(사진에 힌트 있음).
이건 그냥 SFT고, 다음 단계는 RFT(강화 미세 조정)임. 이건 차원이 다른 게임이고 지금 완전 무법지대임. RFT를 하려면 모델이 인퍼런스/롤아웃을 빠르게 돌려야 하고(빠른 토큰 생성 머신이 필수), 거기서 나온 결과에 보상을 줘야 함(코드 빌드하고 테스트하려고 Docker 컨테이너 띄우는 작업 포함). 마지막으로 PPO/GRPO/RLOO 같은 걸로 가중치를 업데이트하는 거지. 인퍼런스랑 가중치 업데이트가 섞인 아주 골 때리는 작업이라 특수한 빌드 환경이 필요한데, 뭐가 정답인지 아는 놈이 아무도 없음. Prime RL 같은 포스트 트레이닝 업체들은 데이터센터 돌리면서 하는데, 내가 알기로 이거 혼자서 제대로 하는 놈은 아직 없음(이제 막 시작하는 중).
아무튼, 이 글이 네 새로운 하드웨어로 흥미로운 여정을 시작하는 계기가 됐으면 좋겠다. 이 모든 게 로컬 LLM 덕분에 가능한 거임. OpenAI는 SFT API 닫아버렸고, RFT API는 가격이 창렬이잖아. 그래서 커스텀 포스트 트레이닝은 오픈 모델 영역에서 할 수 있는 몇 안 되는 돈 되는 프로젝트임. 경쟁이 좀 있고 하드웨어 빨을 타긴 하지만, 돈 벌 기회는 확실히 있음. 즐겨라!
LLM 도움 없이 직접 썼음. 오타나 횡설수설하는 부분은 이해 좀 해줘.


