AI가 인터넷 데이터를 학습했다면, 도대체 이 em-dash들은 다 어디서 튀어나온 거야?
If AI was trained on the internet, where the hell did all the em-dashes come from?
핵심 요약
AI가 인터넷의 일상적인 글이 아닌 고품질의 정제된 텍스트를 주로 학습하면서, 평소 잘 쓰지도 않는 em-dash를 남발하게 되었다는 분석.
- AI 글쓰기 특징 — 평소 잘 쓰지 않는 em-dash를 남발하며 지나치게 정제된 문체를 보임.
- 학습 데이터 편향 — 인터넷의 일상적인 글보다 출판물이나 학술지 같은 고품질 텍스트에 가중치가 높음.
- 지능형 글쓰기 모방 — AI가 똑똑해 보이려는 의도로 격식 있는 문장 부호를 선택적으로 학습함.
- 자동 수정 영향 — iOS나 macOS의 자동 변환 기능이 em-dash 사용을 대중화시킨 측면도 있음.
맹세컨대 5년 전 인터넷은 이런 소리가 아니었어.
댓글창에서 아무도 무심하게 이런 식으로 쓰지 않았지:
“그게 핵심이야, 생산성에 관한 게 아니라 의도에 관한 거라고.”
이제 모든 AI 답변, 링크드인 게시물, 가짜 창업자 스레드, 그리고 '인간미를 더한' 에세이들은 마치 모두가 하룻밤 사이에 뉴요커 편집자가 된 것처럼 em-dash로 가득해.
그게 내가 이해 안 가는 부분이야. 만약 이 모델들이 실제 인터넷 글을 학습했다면, 왜 일반 사람들은 거의 쓰지도 않는 문장 부호를 골라낸 걸까? 레딧은 대부분 오타, 쉼표, 엉망인 문법, 미완성된 생각, 그리고 아무것도 아닌 걸로 싸우는 사람들로 가득했잖아.
이제 AI 글쓰기를 단번에 알아볼 수 있는 결정적인 증거는 어떻게 된 게 가능한 한 가장 세련된 문장 부호를 쓴다는 거야.
마치 AI가 '사람들이 온라인에서 어떻게 글을 쓰는지'를 배운 게 아니라, 사람들이 자기보다 똑똑해 보이려고 애쓸 때 어떻게 글을 쓰는지 배운 것 같아.

