AI가 생성한 10만 개 리포지토리 스캔 결과: 프로덕션 기준 통과율은 단 1%
I Scanned 100K AI generated repos. Only 1% of projects passed production checks
핵심 요약
AI가 생성한 10만 개의 리포지토리를 분석한 결과, 프로덕션 수준의 품질을 갖춘 프로젝트는 1%에 불과함.
- 프로덕션 통과율 — AI 생성 코드 중 실제 서비스 가능한 수준은 1%에 그침.
- 도구별 성능 — Cursor, Bolt 등 주요 AI 도구 간의 품질 차이가 거의 없음.
- 주요 결함 — 로깅, 타임아웃, 보안 설정 등 인프라 및 보안 관련 항목에서 높은 실패율을 보임.
- 분석 방법론 — 정적 분석을 통해 JS/TS 스택 위주로 프로덕션 준비 상태를 평가함.
지난 10일 동안 저는 AI가 생성한 것으로 식별된 공개 GitHub 리포지토리를 대상으로 22개의 프로덕션 준비 상태 점검을 수행했습니다.
총 103,653개의 리포지토리.
점수가 매겨진 리포지토리들의 평균 프로덕션 준비 상태: 53%.
프로덕션 기준을 통과한 것은 단 1%뿐이었습니다.
리포지토리 전반에서 나타난 주요 실패 원인:
- 93% 로깅 없음
- 91% 외부 HTTP 호출에 대한 타임아웃 없음
- 86% API에 인증 가드 없음
- 85% 에러 경계(error boundaries) 없음
- 75% 환경 설정 노출
- 66% 속도 제한(rate limiting) 없음
이러한 패턴은 Lovable, Bolt, Cursor, Windsurf, Claude Code, Replit, Aider, Continue, Trae, Roo 등에서 표시된 리포지토리들 전반에서 유사하게 나타났습니다. 모든 도구 그룹이 평균 51%에서 60% 사이에 머물렀습니다.
방법론:
- 리포지토리는 .bolt/, .lovable/, .cursorrules, .windsurf/와 같은 도구 마커로 식별됨
- 프로덕션 기준은 100점 만점에 86점 이상이며 치명적인 결함이 없는 상태
- 정적 분석만 수행
- JS/TS 스택을 점수화함
- 다른 언어들은 개수에는 포함했으나 점수화하지 않음
방법론에 대한 질문이 있거나 데이터셋에서 추가적인 분석이 필요하시면 댓글로 남겨주세요.


