모델 성능 저하(너프)는 없다
Nothing gets nerfed
핵심 요약
새 모델 출시 후 성능이 저하되었다는 주장은 사용자의 과도한 기대와 프롬프트 최적화 실패 때문이라는 분석입니다.
- 성능 저하 논란 — 새 모델 출시 직후 며칠 만에 성능이 떨어졌다고 주장하는 반복적인 커뮤니티 패턴을 지적함
- 프롬프트 품질 — 모델의 성능을 탓하기 전에 사용자의 프롬프트 작성 능력이 점차 느슨해지는 것이 원인일 수 있음
- 복합적 작업 — 모델은 특정 작업에서 매우 똑똑하다가도 사소한 작업에서 멍청한 실수를 하는 불균형한 특성을 보임
- 실제 활용 사례 — 복잡한 시뮬레이션이나 개발 파이프라인에서 모델을 체계적으로 활용하면 성능 저하를 체감하기 어려움
벌써 1년 넘게 똑같은 소리만 듣고 있다. OpenAI 커뮤니티든 클로드 유저들 사이든, 매번 똑같은 레퍼토리다.
새 모델이 나오면 다들 어떻게 되는지 알잖아. 처음엔 다들 감탄하지. 그러다 한 며칠 지나면 모델이 벌써 너프 먹었다는 농담이 나오기 시작해. 처음엔 그냥 농담이지. 근데 며칠 더 지나면 사람들이 진지하게 받아들이기 시작하고, 결국 꽤 많은 사람이 모델이 진짜로 너프됐다고 확신하게 돼.
현실을 말해주자면, 난 그런 걸 느껴본 적이 한 번도 없다.
5.5가 나왔을 때, 특히 3D 공간을 이해하는 능력, 아니 최소한 3D 장면이나 시각적인 결과물을 만들고, 자기가 만든 걸 관찰하면서 수정해 나가는 능력에 진짜 감탄했거든. 그 능력은 정말 대단했어. 그때도 좋았고, 지금도 전혀 안 나빠졌어. 그냥 그때랑 똑같이 좋아.
글쓰기 실력도 엄청나게 좋아졌지. 4.8이나 5가 보여주던 그 횡설수설하거나 이상하고 암호 같은 스타일이 아니야. 갑자기 4.6 시절 느낌 나는 모델로 돌아왔다고. 솔직히 4.7은 대부분의 경우 좀 멍청하게 느껴졌거든. 근데 지금은 적어도 모델한테 어떤 식으로 말해달라고 하면 그걸 지켜. 논의도 잘하고, 이해할 수 있는 방식으로 자기 생각을 표현한다고.
그러니까 5.5가 너프됐다는 말은, 내 생각엔 Opus 5나 4.8, 4.7 같은 모델을 쓸 때 기분이 어땠는지 까먹은 거야. 그 구형 모델들 쓰다가 지금 이 모델을 써보고도, 이게 훨씬 더 나아진 게 아니라고 진심으로 믿는 건 말이 안 돼.
사실 거의 모든 모델 출시 때마다 이랬어.
다들 무슨 일이 벌어지고 있는지 알잖아. 새 모델이 나오면 이전보다 훨씬 좋게 느껴져서 감탄하지. 근데 그러다 점점 더 복잡한 작업을 시키기 시작해. 더 많이 쓰게 되고, 그러다 한계에 부딪히는 거지. 결국 다시 멍청하게 느껴지기 시작하는 거야.
LLM은 가끔 좀 멍청해. 능력치가 엄청나게 들쭉날쭉한, 자폐 성향 있는 어린 인공지능 아이들 같달까. 엄청나게 뻔해 보이는 작업에서 진짜 말도 안 되게 멍청한 결정을 내리다가도, 다른 면에선 엄청나게 똑똑하거든. 요즘 시대에도 이런 걸 겪는다는 게 놀랍긴 하지만, 그래도 예전보다 훨씬 나아진 건 부정할 수 없는 사실이야.
5.5가 2주 전보다 멍청해졌을 리가 없다고.
내가 왜 이런 글을 쓰고 있는지도 모르겠다. 그냥 모델 너프됐다는 글을 또 하나 봤는데, 거기에 동조하는 댓글이 엄청나게 달린 걸 보고, 나도 참다 참다 한마디 해야겠다 싶어서 글을 쓴다.


