왜 사람들은 계속 요약되거나 검열된 SOTA CoT 트레이스로 파인튜닝을 할까?
Why do people keep fine-tuning on summarized/censored SOTA CoT traces?
핵심 요약
요약되거나 검열된 CoT 데이터를 사용한 파인튜닝이 모델 성능을 오히려 저하시킨다는 의문 제기.
- CoT 파인튜닝 — 요약된 추론 데이터 사용의 실효성 논란
- 모델 성능 저하 — 검열된 트레이스 학습이 모델의 추론 능력을 해칠 가능성
- 데이터 품질 — 파인튜닝에 필요한 충분한 양질의 데이터 부족 문제
- 전략적 선택 — 쉽고 빠른 파인튜닝이 모델 인기를 얻기 위한 지름길로 인식됨
내가 뭘 놓치고 있는 건가? 어떤 사람들은 증류(distillation)가 마법이라도 되는 줄 알고, 베이스 모델이 실제로 할 수 있는 것보다 출력 품질을 높여줄 거라고 생각하는 것 같음. 특히 이런 Fable 파인튜닝들을 보면 정말 이상하게 느껴짐. 내가 이해하기로는, Anthropic 모델에서 얻는 추론 트레이스는 모델이 실제로 출력하는 사고의 연쇄(chain of thought)와는 완전히 다르다는 사실을 간과하고 있기 때문임. 그래서 결과가 이전보다 나빠질 게 거의 확실함.


