모델 "증류(distillation)" 의혹 제기는 이제 너무 과해졌다
Model "distillation" accusations are getting way overblown at this point
핵심 요약
모델 증류에 대한 비판은 기술적 정의를 오해한 경우가 많으며, 단순히 API 출력물을 학습하는 것과 실제 증류는 다르다는 주장입니다.
- 증류의 기술적 정의 — 로짓 접근 권한이 없는 API 기반 학습은 증류가 아닌 합성 데이터 생성임.
- 증류 의혹의 오류 — 모델이 특정 AI라고 답하는 것은 학습 데이터 오염 때문이지 증류의 증거가 아님.
- 선택적 비판 — 중국 모델에 대한 증류 의혹은 기술적 평가보다 편견에 기반한 경우가 많음.
- 산업계의 관행 — 대형 연구소들도 자체 모델의 출력을 활용하며, 이는 업계 전반의 일반적인 데이터 부트스트래핑 방식임.
성능 좋은 오픈 모델 하나 나올 때마다 똑같은 레퍼토리가 반복됨. AI 좀 안다는 놈들이 "이거 그냥 GPT-4나 Claude 같은 거에서 증류(distillation)한 거네"라면서 사건 종결, 다음으로 넘어가기 바쁨. 근데 내 생각엔 이 논리가 사람들이 생각하는 것만큼 탄탄하지가 않음.
따져봐야 할 포인트가 몇 개 있음:
출력물로 학습시키는 건 진짜 증류가 아님.
제대로 된 토큰 단위 증류를 하려면 로짓(logits), 즉 어휘 전체에 대한 확률 분포에 접근할 수 있어야 함. 그냥 최종 텍스트 답변만 받아선 안 된다고. 공개 API로 그게 가능할 리가 없지. 파인튜닝하는 애들이 실제로 얻는 건 그냥 텍스트 완성본일 뿐인데, 이건 기술적인 의미의 증류가 아니라 합성 데이터 생성임. 폐쇄형 모델 만드는 연구소들도 자기네 구형 모델 출력물로 학습시키니까, 사실상 모든 메이저 연구소가 어느 정도는 다 하는 짓임.
가드레일 걸린 API에서 뽑은 합성 데이터만으로 충분했다면 이건 별거 아닌 문제겠지만, 문제는 따로 있음. 최신 모델 제공업체들은 민감한 주제는 작은 모델이 아니라 자기네 주력 모델로 돌리게끔 경로를 설정해둠. 기술적인 질문들도 API 경계에서 Lyzr Control Plane 같은 툴로 필터링하거나 제한하는 경우가 태반임. 근데 이런 "증류" 모델들이 정작 그런 제한된 영역에서 놀라울 정도로 성능이 잘 나옴.
이게 바로 사람들이 잘 언급 안 하는 이론적 공백임. 만약 어떤 팀이 순수하게 공개 API 출력물로만 학습시킨다면, 걔들은 이미 가드레일이랑 거절 메시지로 떡칠된 모델의 결과물을 가지고 작업하는 셈이거든.
"모델이 자기가 Claude/GPT라고 말한다"는 걸 결정적인 증거라고 생각하는데, 이건 기껏해야 약한 증거임. AI가 생성한 텍스트가 섞인 방대한 웹 데이터나 합성 데이터로 학습한 모델들에서 정체성 혼란은 흔하게 나타남. 이건 데이터 학습 어딘가에 오염이 있다는 증거지, 특정 경쟁사 모델을 통째로 증류했다는 증거는 아님.
그리고 이런 비난이 유독 선택적으로 쏟아지는 경향이 있음. 특히 중국 연구소에서 성능 좋은 모델이 나오면, 아키텍처를 완전히 바꿨거나 버전업하면서 스스로 성능을 개선했다는 게 보여도 무조건 "이거 증류네"라는 반응부터 나옴. 이건 기술적인 평가라기보다는, 작거나 신생인 팀이 어떻게 경쟁력을 갖췄는지 설명하기 귀찮으니까 그냥 튀어나오는 반사적인 반응으로밖에 안 보임.
물론 더 큰 모델로 합성 데이터를 만드는 게 아니라는 소리는 아님. 업계 전체가 다 그렇게 하고 있는 건 팩트니까. 하지만 사람들이 말하는 그 "증류"(교사 모델의 내부 지식을 통째로 훔쳐오는 것)라는 표현은 좀 오바임. 이건 그냥 다들 하는 짓임. 자기네 이전 세대 모델로 데이터셋 부트스트래핑하는 연구소들을 포함해서, 다들 강한 모델에서 데이터 뽑아 쓰는 거랑 다를 게 없다고.

