429개의 바이브 코딩 레포지토리를 스캔해 코드베이스가 시간이 지남에 따라 얼마나 변질되는지 측정해 봤음. 결과는 다음과 같음.
Scanned 429 vibe-coded repos to measure how much they drift over time. Here's what I found.
핵심 요약
AI 코딩으로 인해 발생하는 코드베이스의 일관성 저하 현상을 측정하는 도구 'VibeDrift'를 개발하고 분석 결과를 공유함.
- 코드베이스 변질 측정 — AI 세션 간 맥락 단절로 발생하는 코드 불일치 현상을 정량적으로 분석함.
- 주요 실패 유형 — 의미 중복, 명명 규칙 충돌, 아키텍처 불일치 등 5가지 핵심 문제 패턴을 발견함.
- AI vs 전통적 방식 — AI 생성 레포가 전통적 레포보다 일관성 유지 측면에서 더 취약함이 확인됨.
- VibeDrift 도구 — 로컬에서 실행 가능한 오픈소스 도구로 코드베이스의 패턴 일관성을 검사함.
코딩 좀 오래 해본 사람들은 다들 느끼지만 딱히 뭐라 부를지 몰랐던 그 느낌, 코드베이스가 스스로 모순을 일으키기 시작하는 현상을 측정하려고 VibeDrift를 만들었다. 파일 하나는 이렇게 짜고, 다른 하나는 저렇게 짜고. 둘 다 AI가 짰는데 서로가 서로를 모르는 상황인 거지.
실제로 이게 어디서 나타나는지 보려고 실제 저장소 429개를 돌려봤다. 결과는 이렇다.
AI 시대에 깃허브에서 제일 잘나가는 프로젝트들이 오히려 가장 많이 '표류(drift)'하고 있었다.
- denoland/deno — 107K stars — 55.5점 (100점 만점)
- cline/cline — 63K stars — 56.1점 (AI 코딩 툴인데 지들 패턴도 못 지킴)
- langgenius/dify — 146K stars — 58.8점
- langflow-ai/langflow — 149K stars — 61.0점
가장 일관성 있는 곳들:
- lodash/lodash — 99.7점
- expressjs/express — 98.0점
- jquery/jquery — 96.1점
AI 이전의 라이브러리들이 점수가 제일 높고, AI 시대에 급성장한 프로젝트들이 제일 낮다.
모든 저장소에서 공통으로 나타나는 문제점들:
- 의미론적 중복(Semantic duplication) — 19,182건 발견, 저장소의 79%. 서로 기억 못 하는 세션들이 같은 로직을 두 번씩 짬.
- 명명 규칙(Naming conventions) — 7,424건 발견, 저장소의 80%. 같은 코드베이스 안에서 파일끼리 규칙이 서로 정면으로 충돌함.
- 아키텍처 일관성(Architectural consistency) — 2,111건 발견, 저장소의 53%. 같은 문제를 파일마다 구조적으로 다르게 처리함.
- 반환 형태 일관성(Return shape consistency) — 1,733건 발견, 저장소의 58%. 같은 종류의 데이터인데 함수마다 반환하는 형태가 다름.
- 보안 태세(Security posture) — 건수는 적지만 제일 충격적임. Cline, Dify, Deno, Gemini CLI, Ghost 전부 다 저장소 내에서 인증이랑 검증 패턴이 일관성이 없음.
제일 놀라웠던 건 이거다. AI가 생성한 저장소는 중앙값이 86.1점이었는데, 잘 관리된 엘리트 저장소들은 80.8점이었다. AI 세션 하나만 놓고 보면 내부적으로는 일관성이 있는데, 세션이 쌓일수록 표류가 심해지는 거다.
VibeDrift는 무료 오픈소스다. 로컬에서 돌아가고, 데이터가 외부로 나갈 일도 없고, 5초면 끝난다.
npx @vibedrift/cli .
https://www.github.com/VibeDrift/VibeDrift
https://www.vibedrift.ai/
댓글로 퍼블릭 저장소 링크 던져주면 바로 스캔 돌려줄게.


