왜 모든 AI 모델은 웹 앱 코딩을 시키면 똑같이 공격적으로 평범한 디자인으로 수렴할까?
Why does every AI model seem to converge on the same aggressively-mediocre design when asked to code a web app from scratch?
핵심 요약
다양한 AI 모델이 웹 앱 생성 시 유사하고 평범한 디자인을 출력하는 현상은 학습 데이터의 평균값으로 회귀하는 통계적 특성 때문임.
- 디자인 수렴 현상 — 다양한 AI 모델이 웹 앱 생성 시 유사하고 평범한 디자인을 출력함.
- 학습 데이터 편향 — SaaS 랜딩 페이지 등 흔한 템플릿이 모델 학습 데이터의 평균으로 작용함.
- 프롬프트 제약 부족 — 구체적인 스타일 가이드 없이 모호하게 요청하면 모델이 가장 안전한 평균값을 선택함.
- 해결책 제시 — 이모지 사용 금지, 폰트 제한 등 명확한 제약 조건을 설정하거나 레퍼런스 이미지를 제공해야 함.
직장에서 메인 AI 코딩 도구가 사내 웹 디자인 라이브러리를 활용해 시각적으로 매력적인 웹 앱 프로토타입을 빠르게 제작하도록 가르치는 소규모 사이드 프로젝트를 진행 중입니다. 별로 흥미로운 작업은 아니고, 웹 디자인 분야의 대단한 발전이라고 주장할 생각도 없습니다. (웹 앱의 목적은 웹 앱 자체를 판매하는 것이 아니라 앱 뒤에 있는 것을 판매하는 것이며, 앱은 단지 수단일 뿐이고 판매 제안이 완료되면 버려질 것입니다. 앱은 전문적으로 보여야 하며, 우리가 실제로 판매하려는 것에 방해가 되지 않아야 합니다.)
도구가 어떻게 작동하고 최종 결과물에 어떤 영향을 미치는지 보여주기 위해, 저는 여러 AI 모델에게 "React를 사용하여 파일 공유 웹사이트의 사용자 랜딩 페이지를 위한 시각적 프로토타입을 만드시오"라는 동일한 작업을 주었습니다. Opus, Sonnet, Haiku, Qwen3, Kimi, GLM5 등등... 모두가 똑같은 색상 팔레트의 낮 또는 밤 모드를 선택했고, 하나를 제외하고는 모두 디자인에 확대된 이모지가 필요하다고 생각했으며, 모두 같은 폰트를 사용하는 등 똑같았습니다.
같은 모델에게 같은 질문을 여러 번 해서 비슷한 답변을 얻는다면 놀랍지 않았겠지만, 어떻게 모두가 거의 똑같은 디자인으로 강력하게 수렴하게 된 걸까요? (예측 불가능한 결과를 보여주려고 의도적으로) 그렇게 모호한 프롬프트를 사용했는데, 정답에 대한 추측이 서로 완전히 다를 것이라고 생각했습니다.
심지어 좋은 디자인도 아닙니다! 창의성을 바라는 것도 아니지만(사실 창의성은 전혀 필요 없습니다), 모두가 불필요한 공백을 엄청나게 낭비하고 있고, 폰트 크기는 너무 다양하며, 제각각인 스타일의 이모지들 때문에 인터페이스가 너무 복잡해 보입니다. 그리고 보라색은 왜 그렇게 좋아하는 거죠?
이게 단순히 웹사이트 버전의 "이게 아니라 저거라고!" 같은 상황인 걸까요? [잠시만요... 눈꺼풀이 떨려서 타이핑을 멈춰야겠네요...] 아니면 인터넷 전체를 텍스트 모델로 증류한 결과, 어떻게든 '유일한 진정한 UI 디자인'에 합의하게 된 불가해한 결과물인 걸까요?
재미있는 점은, 제 프로젝트의 전체 목적이 사용자들이 제가 만드는 것을 활용해 모두 똑같이 보이는 결과물을 만들게 하려는 것이라는 겁니다... 저희 사내 라이브러리와 똑같이 말이죠. (사내 라이브러리는 이 LLM 기본값보다 훨씬 매력적입니다.) 만약 저희 디자인 라이브러리가 보라색을 많이 사용했다면, 시작하기도 전에 절반은 성공했을 텐데요!
추가: (처음부터 시작한다면) 더 나은 디자인을 얻는 방법은 알고 있습니다. 도구가 사내 라이브러리를 사용하도록 가르치는 제 프로젝트는 잘 작동하고 있고, 모델들은 이제 제가 원했던 대로 저희 사내 스타일을 복사하고 있습니다... 다만 저는 제가 아무런 지시를 내리지 않았을 때 여러 벤더의 모델들이 모두 똑같은 것을 선택했다는 사실이 재미있다고 생각했을 뿐입니다.


