한 연구 결과, 시니어 개발자들은 AI 사용 시 19% 더 느렸지만 스스로는 20% 더 빠르다고 생각했다
A study found senior devs were 19% slower with AI but thought they were 20% faster
핵심 요약
AI를 활용하는 개발자들이 실제로는 더 느려졌음에도 스스로는 더 빨라졌다고 착각하는 현상과 그 원인에 대한 논의.
- 연구 결과 — 시니어 개발자가 AI 사용 시 실제 속도는 19% 느려졌으나 체감 속도는 20% 빨라짐.
- vibe coding — 프롬프트 입력 후 기도하는 방식의 비효율적인 AI 활용법을 지적함.
- AI 활용 단계 — 자동 완성부터 코드 블랙박스화까지 0~5단계로 구분하여 생산성을 분석함.
- 인지 편향 — AI 생성물 검토 및 수정에 드는 보이지 않는 오버헤드를 작업 시간으로 인식하지 못함.
이 통계가 머릿속에서 떠나질 않아서 싸움 좀 붙여보려고 여기 올림.
METR에서 실제 통제된 연구(2025년)를 진행함: 숙련된 개발자들, 이미 알고 있는 레포, 실제 작업. 결과는 AI 도구를 썼을 때 19% 더 오래 걸림. 그런데 이들은 +24% 빨라질 거라 예상했고, 끝난 뒤에는 +20% 빨라졌다고 믿음. 체감 속도와 실제 속도 사이의 간극이 나한테는 제일 충격적임.
AI가 쓸모없다는 뜻은 아님. 우리 대부분이 그걸 가장 멍청한 방식으로 쓰고 있다는 뜻임. 요즘 사람들이 'vibe coding'이라고 부르는 거. 프롬프트 넣고, 기도하고, 반복하기.
Shapiro의 레벨 프레임워크가 이걸 잘 설명함: 0은 자동 완성, 2는 AI가 쓰고 내가 모든 줄을 읽음, 3은 PR만 검토, 4는 사양만 쓰고 코드는 블랙박스가 됨, 5는 아무도 검토 안 함. 개발자의 ~90%는 2와 3 사이에서 정체되어 있는데, 각 단계가 마치 목적지처럼 느껴져서 그걸 모른다는 주장임.
함수 하나(다익스트라)로 직접 테스트해 봄. 코드는 거의 그대로였고 변수는 나뿐이었음. 작지만 의미 있는 순간: 레벨 2에서 모델이 주석에 잘못된 예상 출력값을 적음(비용 7이라고 주장했는데 실제 답은 10). 대충 훑으면 통과하지만, 제대로 읽으면 실패함.
그래서 두 가지 질문: 이 연구를 믿음, 아니면 방법론이 결함 있다고 봄? 그리고 솔직히 본인은 0-5 스케일 중 어디에 있음?
