OpenAI의 감시형 표절
Surveillance plagiarism by OpenAI
핵심 요약
OpenAI가 사용자 데이터를 학습에 활용해 모델을 고도화하고 사용자의 아이디어를 가로채는 행태를 비판하며 로컬 AI 사용을 권장하는 글입니다.
- 데이터 무단 학습 — OpenAI가 사용자 세션 데이터를 학습에 활용해 모델의 자율성을 과장함
- 지식 재산권 침해 — 사용자의 프롬프트를 학습해 수익성 있는 아이디어를 기업이 선점함
- 로컬 AI의 필요성 — 데이터 유출 방지와 보안을 위해 로컬에서 구동되는 모델 사용이 필수적임
- 사용자 기만 논란 — 옵트아웃 설정이 모호하거나 수시로 변경되어 사용자가 데이터 제공 여부를 인지하기 어려움
감시형 표절(Surveillance plagiarism) - 호스팅 AI 기업들이 연구자들의 AI 세션을 학습 데이터로 써먹어서 주가를 펌핑하고 있다. 이렇게 하면 내부 모델이 마치 사람의 도움을 덜 받고도 문제를 해결하는 것처럼 보이거든. 근데 실상은 여러 사람이 중요하다고 생각했던 문제들에 대해 과거에 입력했던 가이드라인을 모델이 그냥 훔쳐 쓰는 거임.
배경 설명을 좀 하자면, Tristan Buckmaster가 OpenAI와 Sebastian Bubeck의 비윤리적인 행태에 대해 성명서를 냈거든. 협박질을 하거나 자기 논문에서 Anthropic 공동 저자를 빼라고 압박했다는 내용인데, 여기서 우리가 주목해야 할 부분은 이거임:
Talia Ringer가 밝힌 바와 같이, OpenAI는 네가 업로드한 데이터랑 OpenAI 세션 내용을 그대로 학습에 써먹는다. 옵트아웃(거부) 설정을 따로 안 하면 말이지. 즉, 얘네 내부 모델이 네가 예전에 했던 프롬프트 작업을 싹 다 긁어다가 지들이 더 똑똑하고 자율적인 척하는 데 써먹을 수 있다는 소리임.
이건 로컬에서 돌아가는 오픈 웨이트 모델을 써야 한다는 확실한 근거가 된다. 특히 남들보다 앞서 나가야 하거나 데이터 유출이 절대 안 되는 상황이라면 더더욱 그렇고.
이 모든 상황을 보면 내부 모델이 사람 도움 거의 없이 어려운 문제를 해결했다는 주장 자체가 존나 의심스러워짐. 호스팅 AI 기업들은 애초에 그 프롬프트가 어디서 튀어나온 건지도 모를걸?


