Navier-Stokes 연구 이후 불거진 개인정보 보호 우려
Privacy concerns after Navier-Stokes
핵심 요약
OpenAI의 연구 성과가 외부 연구자들의 작업과 유사해, 사용자 데이터 무단 학습 및 지적 재산권 침해 의혹이 제기되었습니다.
- 데이터 학습 논란 — OpenAI가 사용자 데이터를 무단으로 학습에 활용했는지에 대한 의혹이 제기됨
- 연구 성과 도용 — 외부 연구자들의 연구 결과와 OpenAI의 결과가 유사해 데이터 유출 가능성이 논의됨
- 개인정보 보호 — 로컬 LLM 사용 외에는 데이터 안전을 보장할 수 없다는 회의론이 확산됨
- 기업 신뢰도 — 기업용 데이터 학습 방지 설정이 제대로 작동하는지에 대한 의문이 커짐
OpenAI의 최고 연구 책임자인 Mark Chen이 남긴 말이다.
"두 가지를 구분해야 한다:
Navier Stokes 연구 과정에서 인간이나 에이전트가 사용자 데이터를 들여다본 적이 있는가? 없다.
우리가 ChatGPT와 Codex를 전반적으로 개선하기 위해 사용자 피드백과 비식별화된 데이터를 사용하는가? 그렇다. 그리고 모든 LLM 기업이 다 그렇게 한다." https://x.com/markchen90/status/2097400166554993041
Tristan Buckmaster와 Levent Alpöge는 OpenAI보다 며칠 앞서 Codex를 사용해 Navier–Stokes 문제에서 진전을 이뤄낸 연구자들이다.
공교롭게도 OpenAI의 결과물은 Levent와 Tristan이 사용한 것과 똑같은 새로운 방법론을 사용했다.
Levent와 Tristan이 정말로 Business/Enterprise/Edu 계정을 쓰지 않았거나, 학습 데이터 활용 거부 설정을 안 했던 걸까? 아니면 그런 건 상관도 없는 문제인가? 만약 후자라면 이건 진짜 심각하게 우려되는 상황이다.
만약 후자가 맞다면, 이건 정말로 걱정스러운 일이다.


