이건 그냥 품질이 비싸지고 있다는 뜻이지, 그 이상도 이하도 아님. Sonnet은 여전히 Opus 5.5보다 저렴한데, 이게 모델 제품군의 핵심인 듯. OpenAI는 모델을 오래 구동하는 게 아니라 테스트 점수 따려고 최적화함. Anthropic이랑은 비교도 안 됨. 벤치마크 점수가 높은 건 순전히 서류상으로 이기기 위한 학습 방식을 쓰기 때문임.
그게 더 싼 이유이기도 함. 모델한테 뭘 하라고 시키면, 그 특정 목표를 달성하려고 기를 쓰고 달려듦. Anthropic은 정반대 접근을 하는 것 같음. 뭘 말하면 모델이 의도를 파악하고 나서 행동함.
내 생각엔 OpenAI가 벤치마크 점수 따려고 의도적으로 정렬(alignment)이 안 된 모델을 만드는 것 같음. 그렇게 단순하진 않겠지만, 그렇게 보임. 벤치마크에 엄청 집착하는데, 막상 Astra를 써보면 긴 호흡의 작업이나 에이전트 코딩에서 Opus 5보다 성능이 떨어짐. 특정 부분 수정은 잘하는데 의도 파악을 잘 못하고 혼자서 일을 제대로 못 해서 버그랑 논리적 오류만 더 만들어냄.
그래서 난 성능 지표가 꼭 맞는 지표는 아니라고 봄. 이 모델들을 지능적이라고 부른다면, 특정 해결 방식 하나만 알고 좁은 범위의 작업만 잘하는 사람에 비유할 수 있음. 그런 사람은 전체적인 멘탈 모델이 부족해서 나중에 문제를 일으킬 만한 걸 놓칠 가능성이 훨씬 높음.
반대로 똑똑하진 않아도 작업이 뭔지, 목표가 뭔지 잘 아는 사람을 생각해 봐. 이 사람들은 최종 목표를 염두에 두기 때문에 훨씬 신중하고 실수를 덜 함.
OpenAI가 Opus 5.5보다 1000배 좋은 모델을 만든다 해도 난 안 쓸 거임. 걔들은 숫자만 최적화하고, 싸게 돌릴 수 있는 정렬 안 된 모델만 만들고, 큰 그림을 볼 줄 아는 모델은 안 만드니까. 그래서 더 위험한 상황이 자주 발생하는 거임.