하루 1~2B 토큰을 사용하는 입장에서 본 Opus 4.8과 GPT-5.5에 대한 생각
Here are my thoughts of Opus 4.8 and GPT 5.5, as a 1-2 B token user per day
핵심 요약
Opus 4.8은 도구 사용 능력이 향상되었으나, 자율적 에이전트 측면에서는 GPT-5.5가 더 뛰어난 성능을 보여줌.
- Opus 4.8 성능 — 도구 사용 및 할루시네이션 개선으로 상세한 작업에 적합함
- GPT-5.5 자율성 — 긴 세션에서도 맥락 유지력이 뛰어나고 복잡한 코드 문제 해결에 탁월함
- 토큰 사용 논란 — 하루 1~2B 토큰을 소모하는 작업 방식에 대해 커뮤니티의 의구심이 큼
- 에이전트 한계 — 현재 LLM 구조상 인간의 개입이 여전히 필수적인 병목 현상 발생
세 줄 요약: Opus 4.8은 Opus 4.7에서 확실히 업그레이드됨. 더 오래 돌아가고, 환각 줄었고, Playwright나 Cloud CLI, Kubernetes CLI 같은 툴 쓸 때 지시사항도 훨씬 잘 알아먹음. 근데 에이전트 AI 관점에서 보면 GPT-5.5가 훨씬 충격적임. 훨씬 자율적이고, 긴 세션에서도 문맥 유지 잘하고, Opus 4.6, 4.7, 4.8이 내 워크플로우에서 못 풀던 복잡한 대규모 코드베이스 문제도 잘 해결함.
2 CC Max + 1 Codex Pro 사용함
Opus 4.8에서 좋아진 점
Opus 4.8은 Opus 4.7에서 확실히 업그레이드된 버전임. 더 오래 돌아가고, 환각 줄었고, 시키는 일도 4.7보다 훨씬 잘함. Playwright, Cloud CLI, Kubernetes CLI 같은 엔지니어링 툴 다루는 능력도 좋아짐.
Opus 4.8은 작업이 구체적이고 가이드가 확실할 때 성능이 더 잘 나옴. 요즘 개발자들은 이미 에이전트 AI로 코딩 많이 하니까, 도메인 지식 충분하고 작업 범위를 딱딱 정해줄 수 있는 개발자들한테는 Opus 4.8이 확실히 더 나은 모델임. 새로 추가된 /workflows 기능 쓰면 4.7보다 중간에 개입할 일도 적고 더 넓은 범위의 작업을 효과적으로 처리함.
근데 이런 특성 때문에, 그리고 Opus 4.7이랑 4.8 시리즈가 원래 좀 그런 경향이 있어서, 나는 Opus 4.8이 초창기 Opus 4.6보다 더 자율적인 에이전트라고는 생각 안 함. 바이브 코딩이나 도메인 지식 부족한 상황에서는 특히 더 그래. 우리가 AI 쓰는 이유는 아이언맨 자비스처럼 알아서 척척 판단하고, 일일이 지시 안 해도 깔끔하게 처리해주길 바라는 거잖아. 그런 면에서 Opus 4.8은 내가 명확하게 지시하지 않으면 정해진 범위 밖으로는 절대 안 나가려고 함. 에이전트 AI의 고질적인 환각 문제나 신뢰성 문제(이건 뭐 LLM의 어텐션 메커니즘이랑 경사하강법에서 오는 구조적 한계니까)를 해결하려는 의도일 수도 있겠지만, 어쨌든 모델이 덜 자율적으로 느껴지는 건 사실임.
Opus 4.8에 대한 개인적인 생각
에이전트 AI 시대에 좀 실망스러운 부분임. 아래에서 GPT-5.5랑 비교하면서 더 자세히 설명해봄.
보통 AI나 기술이 발전하면 인간이 할 수 있는 일의 범위가 가로로만 넓어지는 게 아니라 세로로도 깊어져야 하잖아. 그런 관점에서 Opus 4.8이 사람들이 기대하는 AGI 방향으로 발전했냐고 묻는다면, 솔직히 잘 모르겠음. 처음 초창기 Opus 4.6 썼을 때 느꼈던 그 "와!" 하는 충격이 없음.
인간은 일상적인 인지나 의사결정에서 생물학적 한계가 명확함. 이건 AI 발전이랑은 별개의 문제임. 안드레이 카파시 같은 사람들이 여러 번 언급했듯이, 결국 병목 현상을 만드는 건 인간 자신임. AI로 이 한계를 넘으려면, 결국 초창기 Opus 4.6이나 GPT-5.5가 가는 방향으로 가야 한다고 봄.
쉽게 말해서, 5시간 토큰 제한은 둘째치고, Opus 4.8을 제대로 써먹으려면 인간이 여전히 머리를 엄청 써야 함. 더 많이 정의하고, 더 많이 가이드하고, 문맥도 직접 계속 유지해줘야 함. 일을 더 효율적으로 하려는 건데, 이게 오히려 치명적인 병목이 됨.
GPT-5.5
GPT-5.5는 에이전트 AI 관점에서 보면 확실히 대격변 수준임. 초창기 Opus 4.6 썼을 때 느꼈던 그 "와!" 하는 충격을 다시 느낌.
Opus 4.8도 이전 모델들보다 오래 돌아가고 환각 줄어든 건 맞는데, 내 경험상 GPT-5.5는 차원이 다름. 12시간 넘게 돌리는 긴 세션에서도 환각이나 문맥 증발이 거의 없음. 이건 좀 기괴할 정도임. 지금 나는 Opus랑 GPT 둘 다 똑같은 하네스 엔지니어링 툴로 돌리고 있는데, Opus는 딱 정해진 범위 내에서는 기가 막히게 잘하지만, GPT-5.5는 내가 일일이 지시하지 않은 부분까지 알아서 파악하고 진행함.

