Opus 4.6은 정말 '병 속의 번개' 같은 존재다
Opus 4.6 really is lightning in a bottle
핵심 요약
최신 모델보다 Opus 4.6이 코딩 작업에서 더 직관적이고 과잉 설계 없이 의도를 정확히 파악한다는 사용자 경험 공유.
- 모델 성능 비교 — 최신 모델보다 4.6 버전이 사용자의 의도를 더 잘 이해하고 단순한 해결책을 제시함
- 과잉 설계 문제 — 최신 모델들은 불필요하게 복잡한 해결책을 제시하는 경향이 있음
- 투명한 사고 과정 — 4.6 버전은 사고 과정을 읽을 수 있어 실수를 즉시 수정하기 용이함
- 추론 수준 조절 — 작업 성격에 따라 추론 수준을 다르게 설정하는 것이 효율적임
난 이것저것 다양한 프로젝트를 해. 바이오테크, 주식 데이터 분석, 그냥 평범한 UI+백엔드 스타트업, 오디오 신호 처리까지.
그중에서도 마지막 프로젝트가 지금까지 제일 골치 아팠어. 진짜 난이도 높은 문제라 내가 특히 신경 쓰고 있거든.
한 2~3주 동안 GPT 5.6 sol, extra high, Fable 5, extra high, Opus 4.8 extra high, Opus 5 extra high 얘네들 붙잡고 아주 생쇼를 했지.
내 통찰이랑 이것저것 자세하게 지시도 내려봤는데, 조금씩 진전이 있는가 싶다가도 "아, 이거 사실은 학습/테스트 데이터가 섞여서 정보가 샌 거였네" 같은 상황이 계속 터지는 거야. 결국 원점으로 돌아가고, 또 삽질하고 무한 반복이었지.
그러다 그냥 Opus 4.6이나 한번 써보자 싶었어. 내가 원래 얘를 좀 좋아했거든. 이유는 세 가지야.
- 진짜 내 말을 알아듣고 의도를 정확히 파악함.
4.8은 자꾸 딴소리하면서 "아, 그건 틀렸다고 말씀드려야겠네요" 이 지랄을 해서 내가 "아니, 내 말은 그게 아니라..." 하고 다시 설명해야 했거든. Fable 5는 지 혼자 15단계 앞서 나가서 결과도 제대로 안 알려주고. 물론 똑똑한 건 알겠는데, 너무 제멋대로야.
- 일을 너무 복잡하게 안 만듦.
Opus 5, Fable 5, 그리고 GPT 5.6까지, 얘네들은 내가 시킨 것보다 일을 훨씬 더 꼬아버리는 경향이 있어. 물론 더 깊게 생각하는 건 좋은데, 내가 잘 모르는 분야에서는 굳이 안 해도 될 짓까지 다 갖다 붙이더라고. 그냥 내가 말한 대로 제일 간단하게 해결하면 되는데 말이야.
GPT 5.6은 하나에 꽂히면 끝도 없이 파고드는데, 가끔은 내가 방향을 좀 수정해 줘야 할 때가 있거든.
반면에 Opus 4.6은 내가 시킨 거랑 제일 비슷하게, 일단 간단한 해결책부터 내놔. 근데 웃긴 게 뭔지 알아? Opus 4.6으로 블라인드 테스트를 해봤더니, 최신 모델들이 2~3주 동안 삽질하면서 겨우 낸 결과보다 더 잘 나오거나 비슷하더라고. 그냥 내가 문제 파악한 대로 정확히 시키니까 속도도 딱 맞고 진도가 쭉쭉 나가는 거야.
Opus 5가 얼마나 멍청한 짓을 많이 했냐면, 데이터 경로까지 다 깔끔하게 정리해서 줘도 엉뚱한 소리를 해. "잠깐, 데이터 해석이 잘못됐어. 다시 해달라고 해서 다행이지, 이거 완전 틀렸네" 이런 소리를 2~3번씩 반복하는데, 어떻게 믿고 맡기겠냐고.
- 얘가 무슨 생각을 하는지 읽을 수 있음.
이게 진짜 대박이야. 잘못된 거나 오해한 거 있으면 바로바로 수정할 수 있거든. 예를 들어, 얘가 엉뚱한 걸 찾으려고 하면 그냥 경로 딱 찍어주고 설명하면 끝이야. 토큰 낭비할 필요도 없고, 중간에 멈추고 방향 틀 수 있으니까 훨씬 빠르지.
방금 읽었겠지만, 왜 5개월이나 지난, 벤치마크 점수도 낮은 모델이랑 작업할 때가 더 잘 풀리는 걸까? 모든 걸 다 해결할 순 없어도, 일단 작업 과정이 쾌적하고 훨씬 믿음이 가.
가끔은 Opus 4.6이 그냥 운 좋게 잘 만들어진 모델이라 다시는 이런 놈 안 나올까 봐 걱정돼. 딱 필요한 만큼 똑똑해서 내가 뭘 원하는지 정확히 알고, 내가 이해하기 쉬운 방식으로 설명해 줬거든. 내가 좀 귀찮아서 대충 말해도 이전 대화 맥락 다 파악해서 찰떡같이 알아듣고, 내가 뭐 잘못 알고 있다고 훈수 두지도 않았어.
물론 다른 모델들도 장점은 있어. 이전 모델들이 못 찾던 걸 찾아내서 문제 해결 속도를 높여준 적도 있긴 해. 근데 결국엔 다시 Opus 4.6으로 돌아와서 제대로 진도를 빼고 있네. 뭐 내 실력이 부족해서 그런 거라 할 수도 있겠지만, 5개월 동안 에이전트 코딩만 파고들면서 내 의도를 정확히 전달하는 루틴까지 만든 사람으로서 하는 말이야.
제발 얘네들이 이 모델 좀 오래오래 유지해 줬으면 좋겠다.
