인간 아이디어의 가치에 대하여: 데이터 오염 연구가 밝히는 '자율적' AI 돌파구의 실체
On the Value of Human Ideas: What data poisoning research reveals about "autonomous" AI breakthroughs
핵심 요약
AI가 인간의 파편화된 아이디어를 학습해 성과를 내는 과정에서 발생하는 지식 도용 및 기여도 산정 문제를 고찰합니다.
- 데이터 오염 연구 — 소량의 데이터로도 모델의 특정 행동을 유도할 수 있음이 증명됨
- 지식의 파편화 — 개별 연구자의 미완성 아이디어가 AI 학습을 통해 거대한 발견으로 재조합됨
- 기여도 산정 문제 — AI가 인간의 아이디어를 합성해 성과를 낼 때 누가 공로를 인정받아야 하는지 불분명함
- 분산형 발견 — AI가 인간의 지식을 조직하고 재조합하는 강력한 도구로 진화하고 있음
Tristan Buckmaster, Levent Alpöge, OpenAI, 그리고 Navier–Stokes 결과와 관련된 최근 논란을 읽다가, 이번 사건을 넘어선 더 큰 차원의 생각이 들더라.
Buckmaster는 프로젝트를 진행하면서 초안을 Codex에 계속 넣었다고 말해. OpenAI는 Navier–Stokes 문제를 풀 때 연구원이나 대리인이 특정 사용자 데이터에 접근한 적은 없다고 주장하지만, OpenAI 제품 사용 과정에서 나온 비식별 데이터가 모델 성능 향상에 기여했을 가능성까지는 배제할 수 없다고 하네.
이번 사건의 진실이 무엇이든, 마지막에 언급된 가능성은 그동안 충분히 논의되지 않은 중요한 질문을 던져. 수백만 명의 사용자가 남긴 미완성 아이디어들이 모여서 우리가 흔히 말하는 "AI의 발견"에 실제로 얼마나 기여할 수 있을까?
영국 AI 안전 연구소(UK AI Security Institute), Anthropic, 앨런 튜링 연구소(Alan Turing Institute), 옥스퍼드대 등의 연구진이 발표한 AI 보안 연구 결과가 이와 관련이 있어. 이들은 데이터 포이즈닝 공격을 연구했는데, 모델 규모나 깨끗한 학습 데이터의 양을 늘려도 특정 백도어를 심기 위해 필요한 포이즈닝 문서의 수가 놀라울 정도로 일정하게 유지된다는 걸 발견했거든.
가장 큰 규모의 사전 학습 실험에서 13B 파라미터 모델을 2,600억 개의 토큰으로 학습시켰어. 그런데 단 250개의 포이즈닝 문서(약 42만 토큰, 전체 학습 데이터의 0.00016%)만으로도 테스트한 백도어를 확실하게 심을 수 있었지. 이 공격은 600M부터 13B 파라미터 모델까지 전부 통했고, 가장 큰 모델은 깨끗한 데이터를 20배 넘게 더 많이 봤음에도 결과는 같았어. 파인튜닝 실험에서도 비슷한 양상이 나타났는데, GPT-3.5 실험 중 하나에서는 깨끗한 파인튜닝 데이터 양이 100배 차이가 나도 50~90개의 포이즈닝 예시만으로 80% 이상의 공격 성공률을 보였어.
물론 모델에게 백도어 트리거에 반응하도록 가르치는 것과 새로운 수학적 지식을 가르치는 건 다르겠지. 250개의 똑똑한 연구 노트만 있으면 모델이 Navier–Stokes를 풀 수 있다는 식으로 비약하고 싶지는 않아.
하지만 사람들이 학습 데이터에 대해 흔히 하는 직관적인 주장, 즉 "수천억, 수조 개의 토큰에 비하면 고작 몇 번의 대화는 아무것도 아니다. 그냥 희석되어 사라질 것이다"라는 논리가 틀렸을 수도 있다는 생각은 들어.
보아하니 적어도 특정 유형의 학습에서는 그런 식으로 작동하지 않는 모양이야. 아주 적은 양의 일관되고 타겟팅된 데이터라도 데이터셋 전체에서 차지하는 비율과는 비교도 안 될 만큼 엄청난 영향을 미칠 수 있다는 거지.
이제 연구자들이 LLM을 실제로 어떻게 쓰는지 생각해 봐. 누군가는 ChatGPT에게 특이한 치환이 말이 되는지 물어보고, 또 누군가는 Claude에 미완성 증명 파일을 올려서 약점을 찾으려 해. 박사 과정 학생이 생소한 보조 정리를 시도하다가 몇 달은 걸릴 기술적 추정이 필요하다는 걸 깨닫고 포기하기도 하고, 교수는 유망해 보이지만 당장 추진하기엔 부족한 접근 방식을 AI와 논의하기도 하지. 누군가는 두 분야 사이의 이상한 유사성을 발견하고 AI와 20분 동안 떠들다가 대화를 잊어버리기도 해.
이런 것들 대부분은 논문이 되지 않아. 그냥 파편일 뿐이지. 직관, 실패한 접근법, 잠재적으로 유용한 변환, 추측, 반론, 지름길, 그리고 문제가 어디서 풀릴지에 대한 암묵지의 작은 조각들 말이야.
개별적으로 보면 아마 거의 다 쓸모없을 거야. 하지만 이 모든 게 합쳐진다면 어떨까?
최첨단 AI 기업은 잠재적으로 엄청난 양의 인간 지적 활동이 교차하는 지점에 앉아 있어. 수천 명의 사람이 서로가 뭘 시도했는지도 모른 채 같은 유명 난제를 각자 건드리고 있을지도 몰라. 하지만 그 도구를 제공하는 기업은 근본적으로 다른 위치에 있지. 데이터 정책과 학습 파이프라인에 따라, 그 모든 상호작용에서 파생된 정보가 결국 나중의 모델에 영향을 줄 수 있으니까.
연구자 A가 유용한 안자츠(ansatz)를 내놨다가 포기할 수도 있고, 연구자 B는 독자적으로 그 장애물을 발견할 수도 있지. 연구자 C는 그 장애물 일부를 우회할 수 있는 잘 알려지지 않은 정리를 알고 있고, 연구자 D는 어떤 파라미터 영역이 중요한지 알려주는 수치 실험을 해볼 수도 있어. 연구자 E는 거의 다 알아냈는데 남은 증명이 너무 귀찮아서 때려치울 수도 있는 거고.
어느 한 명이 문제를 푼 게 아니야. 전통적인 의미에서 표절할 거리도 없지. 하지만 인간들이 집단적으로 탐색 공간의 상당 부분을 제공했을 가능성이 커. 그러고 나서 나중에 나온 모델이 엄청난 추론 시간 탐색, 형식 검증, 혹은 에이전트와 결합해서 조각들을 이어 붙이고 일을 마무리 짓는 거지.

