OpenAI는 유료 사용자가 학습 거부를 선택했더라도 모든 상호작용을 사용할 수 있다
OpenAI can use all interactions of paid users, even if they opted out of training
핵심 요약
OpenAI가 추론 토큰을 통해 유료 사용자의 데이터를 학습에 활용할 가능성이 제기되며 로컬 LLM의 중요성이 강조됨.
- 추론 토큰 활용 — OpenAI가 학습 거부 정책을 우회해 추론 데이터를 모델 개선에 사용할 가능성이 제기됨.
- 기업 기밀 유출 — 클라우드 AI 사용 시 기업의 지식 재산권이 경쟁사 모델 학습에 악용될 위험이 있음.
- 로컬 AI 전환 — 데이터 보안을 위해 외부 API 대신 로컬 환경에서 직접 모델을 운영해야 한다는 의견이 지배적임.
- 정책 불신 — OpenAI와 Anthropic의 모호한 데이터 처리 방식이 기업 CIO들에게 큰 우려를 낳고 있음.
걔네 옵트아웃 약관 보니까 추론 토큰(reasoning tokens)에는 적용이 안 되는 것 같네.
소비자들은 OpenAI로부터 숨겨진 추론 토큰을 직접 받는 게 아니니까, 이게 유료 사용자 옵트아웃 정책에서 보호하는 "출력물(Output)"에 포함되는지 자체가 불분명함. 예를 들어 약관에는 우리가 출력물에 대한 책임이 있고 소유권을 가진다고 되어 있는데, 추론 토큰에 대해서는 말이 안 되는 소리지.
이게 왜 중요하냐면, 추론 과정에는 사용자 입력값부터 최종 출력값까지 모델 학습에 필요한 모든 알짜 정보가 가공된 형태로 들어있거든. 그래서 OpenAI가 지금 내세우는 보장이 사실상 껍데기뿐인 셈임.
반면에 OpenAI 서비스 이용 약관(API)이나 Anthropic 약관을 보면, 옵트아웃으로 보호받는 출력물을 사용자가 "받아야 한다"는 식의 언급은 없음.
만약 이게 사실이라면, 추론 토큰을 모델 성능 개선을 위한 합성 데이터 생성에 써먹거나, 아예 사전 학습(pretraining)이나 중간 학습(midtraining) 데이터셋에 그대로 집어넣을 수도 있다는 거임. 이러면 자기들이 CoT(Chain of Thought)에 RL 최적화 압력을 가하지 않는다고 말하는 거랑도 딱히 충돌 안 하거든.
