AI가 '바이브 코딩'을 얼마나 잘하는지 신경 안 쓰는 건 나뿐인가?
Am I alone in not caring how well an AI can "Vibe Code"?
핵심 요약
AI의 코딩 능력 평가에 회의적인 작성자가 실질적인 유용성(튜터링, 정확성, 출처 표기)을 강조함.
- 코딩 벤치마크 — AI의 코딩 능력을 과도하게 평가하는 현상에 대한 비판
- 실질적 요구사항 — 튜터링 기능, 정확성, 출처 표기 등 실용적인 성능을 중시함
- 모델 비교 — Gemini가 Sonnet이나 GPT 등 경쟁 모델에 비해 실사용 성능이 뒤처진다고 지적함
모든 AI 토론이나 비교가 '바이브 코딩'을 얼마나 잘하느냐에 집중되는 것 같음. 이 모델이 이 쓰레기 같은 바이브 코딩 테스트에서 최고 점수를 받으면 최고라고 함... 하지만 일주일 뒤 새 모델이 나오면 그건 또 바뀜.
결국 난 신경 안 씀. 난 그 쓰레기 같은 것들을 적극적으로 혐오하고 싫어함.
내가 관심 있는 건 가격 책정이 얼마나 합리적인지, 또 다른 중요한 작업인 '튜터' 역할을 얼마나 잘 수행하는지임. 얼마나 집중력을 유지하는지, 환각 현상은 얼마나 적은지, 그리고 출처를 얼마나 잘, 자주 인용하는지가 중요함.
아니면 나만 유별난 건가? Gemini 3.5 Pro가 쓰레기 코드를 얼마나 잘 만들어내든 난 신경 안 씀. 현재 Gemini 버전은 내 다른 벤치마크 기준에서 Sonnet 5나 GPT 5.6 Sol보다 눈에 띄게 뒤처짐. Sonnet 5와 5.6 Sol은 컨텍스트 윈도우가 더 작지만... Gemini보다 훨씬 더 잘 활용함.


