코딩 벤치마크는 가장 간결한 솔루션에도 보상을 줘야 함. 현재 코딩 에이전트들은 너무 비대하고 복잡한 코드만 짜고 있음.
Coding benchmarks should also reward the leanest possible solution. Coding agent currently build crazy bloated code right now.
핵심 요약
코딩 AI 모델들이 지나치게 복잡하고 비대한 코드를 생성하는 문제와 그 원인인 벤치마크 구조에 대한 논의입니다.
- 비대화 문제 — AI 모델이 보안과 테스트를 과도하게 적용하여 코드가 지나치게 복잡해짐
- 벤치마크의 한계 — SWE-bench 등 주요 지표가 코드의 간결함보다 통과 여부만 평가함
- 비즈니스 모델 의혹 — AI 기업들이 토큰 사용량을 늘리기 위해 의도적으로 비대한 코드를 유도한다는 의견
- 해결 전략 — 모델에게 상세한 계획을 먼저 세우게 한 뒤 불필요한 부분을 제거하는 방식이 효과적임
모델을 계속해서 빡세게 가이드하지 않으면, Codex나 Claude Code 같은 놈들은 뭐든 너무 과하게 오버하는 느낌임.
나도 수동으로 계획 짜고 검토도 꼼꼼히 하는데, 조금이라도 한눈팔면 모델이 바로 보안이니 테스트니 복잡도니 하면서 일을 너무 크게 벌여버림.
지금 B2B 대시보드 기반을 만들고 있는데, 핵심 모듈에다가 보안 기능을 얼마나 떡칠하려고 드는지 진짜 어이가 없을 정도임.
진짜 아무것도 모르는 상태에서 그냥 '바이브코딩'하는 애들 입장에서는, 이제 모델 쓰는 게 편해지기는커녕 오히려 더 어려워진 것 같음.
모델이 마치 "정석대로/제대로" 하고 있는 것처럼 착각하게 만드는데, 실상은 그냥 코드만 존나게 무겁게 만드는 거니까.


