Opus 4.8을 3일 써보고 생각이 바뀌었다. '결과가 나쁘다'는 불평은 프롬프트 문제인 듯
Changed my mind on Opus 4.8 after three days, I think a lot of the "worse results" complaints are a prompting thing
핵심 요약
Opus 4.8은 세세한 지시보다 명확한 목표를 제시할 때 훨씬 뛰어난 성능을 발휘합니다.
- 프롬프트 방식 변화 — 세부 지시 대신 명확한 목표를 제시해야 함
- 모델 활용법 — AI를 수동으로 제어하기보다 숙련된 팀원처럼 대우해야 함
- 성능 체감 — 코드 작성 및 버그 수정 능력에서 이전 모델보다 우수함
- 사용자 피드백 — 모델의 변화에 적응하지 못한 사용자들의 불만이 다수 존재함
며칠 전 4.8에 대한 평가가 엇갈린다는 글을 올렸고, 솔직히 저도 그쪽 입장이었습니다. 첫날에는 장황하고, 약간 딱딱하고, 학구적인 느낌이 들었거든요. 몇 가지 이유가 있었던 것 같은데, AI가 아첨하는 것처럼 보이지 않으려고 억지로 반대 의견을 내거나, 왜 그런 행동을 하는지 과도하게 설명하는 것도 포함되어 있었습니다. 하루 이틀 지나니 그런 현상은 좀 가라앉은 것 같은데, 이건 제 주관적인 느낌일 뿐이고 시스템 프롬프트가 조정되었거나 제가 적응한 것일 수도 있습니다.
하지만 제가 깨달은 더 큰 문제는 제가 이 모델을 이전 모델처럼 사용하고 있었다는 점입니다. 모든 것에 대해 단계별로 명시적인 지시를 내리고 있었죠. 그런데 4.8에서는 그런 방식이 오히려 역효과를 냅니다. 작업을 과도하게 생각하고 토큰만 낭비하게 되거든요.
이 모델이 진짜 빛을 발하는 순간은 명확한 목표만 던져주고 알아서 단계를 찾게 할 때입니다. 프롬프트를 짧게 쓰라는 게 아닙니다. 여전히 가능한 한 많은 컨텍스트를 넣고 있지만, '어떻게' 할지 일일이 적는 대신 제가 실제로 달성하려는 목표가 무엇인지에 지시를 집중합니다. AI를 일일이 손잡고 가르쳐야 하는 대상이 아니라, 팀의 똑똑한 선임처럼 대우하세요.
이 점이 가장 크게 와닿았던 건 Claude를 위한 기술을 구축할 때였습니다. 각 기술이 무엇을 해야 하는지 정의하는 데 있어서 저보다 훨씬 낫더군요. 이는 Anthropic이 공개한 시스템 카드 내용과도 일치합니다. 그들이 말하길, 이 모델은 자신이 작성한 코드의 버그를 잡아낼 확률이 약 4배 더 높다고 하더군요.
모델이 점점 좋아져서 그 모델로 만드는 것들까지 개선할 수 있게 된다는 게 참 묘한 깨달음입니다. 어쨌든 4.8이 처음에 이상하게 느껴졌다면, 포기하기 전에 목표 중심적인 접근 방식을 먼저 시도해 볼 가치가 있을 겁니다.


