GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5에게 동일한 프론트엔드 과제 100개를 맡겨본 결과 (300개 결과물)
I gave GPT-5.6 Sol, Claude Opus 4.8, and Grok 4.5 the same 100 frontend briefs—here are all 300 results
핵심 요약
AI 모델별 프론트엔드 디자인 결과물을 비교하는 벤치마크 사이트 'Sitegeist'를 제작하여 공개함.
- 모델별 디자인 비교 — 3개 모델의 동일 과제 결과물을 통해 시각적 특징과 일관성 확인 가능
- 벤치마크 도구 공개 — 100개의 과제와 300개의 결과물을 통해 모델의 디자인 편향성 분석
- 오픈 소스 프로젝트 — 누구나 벤치마크 결과를 확인하고 소스 코드를 살펴볼 수 있음
- 디자인 품질 논쟁 — AI 생성 웹사이트의 품질 저하와 업계의 미래에 대한 우려 제기
코딩 모델로 웹사이트를 충분히 생성해 본 결과, 각 모델이 결국 비슷한 시각적 아이디어에 도달한다는 사실을 깨달았습니다.
인상적인 스크린샷 하나만으로는 그것이 실제로 사실인지 알 수 없기에, 더 큰 규모로 테스트해 보기로 했습니다.
GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5에게 동일한 프론트엔드 디자인 과제 100개를 맡겼습니다. 건축, 딥테크, 스킨케어, 스트릿웨어, 커피 등 서로 관련 없는 카테고리를 포함하여 총 300개의 웹사이트를 생성했습니다.
모든 결과물을 'Sitegeist'라는 벤치마크에 넣었습니다. 동일한 과제에 대해 세 모델을 비교하거나, 한 모델의 작업물을 전체적으로 살펴보며 타이포그래피, 히어로 레이아웃, 색상 선택, 기하학적 요소, 정보 밀도, 전체적인 구성 등 반복되는 시각적 지문을 확인할 수 있습니다.
이것은 디자인 품질이나 독창성을 완벽하게 객관적인 점수 하나로 환원할 수 있다고 주장하려는 것이 아닙니다. 이 실험의 유용한 점은 규모와 일관성입니다. 300개의 결과물을 모두 확인할 수 있어, 몇 가지 예시만 골라낸 것이 아니라 동일한 100개의 과제를 세 모델에게 맡긴 결과를 모두 볼 수 있습니다.
여기서 확인해 보세요:
공개: 제가 이 벤치마크를 만들었습니다.

