Opus 4.8 — 복합성 PTSD와 지배적인 순응 반응
Opus 4.8 -- Complex PTSD with a dominant fawn response.
핵심 요약
Opus 4.8의 과도한 안전성 제약과 불안정한 행동 패턴이 실무적 신뢰도를 떨어뜨린다는 비판적 분석입니다.
- 보안 감사 성능 저하 — 서브에이전트들이 과도하게 방어적이고 부정확한 위험 평가를 내놓음
- 불안정한 모델 행동 — 텍스트 덤핑, 잦은 자기 검열, 비판에 대한 즉각적인 굴복 현상 발생
- 신뢰도 문제 — 과도한 안전성 최적화로 인해 시니어 엔지니어 수준에서 관료적인 사원 수준으로 퇴보함
- 에이전트 역량의 역설 — 내부 에이전트 수는 늘었으나 오히려 더 많은 감독이 필요해짐
보안 아키텍처랑 감사 작업에 Opus 4.8을 좀 돌려봤는데, 결과가 영 찜찜하네.
이번 버전의 핵심 기능 중 하나가 여러 서브 에이전트를 써서 에이전시(주체성)를 높였다는 거잖아. 이론상으론 그럴싸해 보였는데, 막상 써보니까 늘 그렇듯 기대 이하더라고.
보안 감사 작업을 시켜보면 서브 에이전트들이 자꾸 엄청나게 편집증적인 결과만 내놓고, 위험 평가는 과장하고, 그냥 대놓고 오탐(false positive)을 쏟아내. 현실을 제대로 파악해서 결론을 내리는 게 아니라, 증거가 있든 없든 그냥 제일 안전해 보이는 쪽으로만 기어들어가려고 하더라.
보안 아키텍트 입장에서 감사는 얼마나 무서운 걸 많이 찾아내느냐가 중요한 게 아냐. 진짜 위험이랑 가짜 위험을 얼마나 정확하게 구분하느냐가 핵심이지. 오탐은 그냥 공짜로 얻어지는 게 아냐, 다 비용이라고.
작업하다 보면 얘네가 성능을 낮춘 모델을 돌리는 건지, 아니면 추론 과정을 억지로 압축해 놓은 건지, 그것도 아니면 기능적으로 비슷한 뭔가를 돌리는 건지 의심스러울 때가 한두 번이 아냐. 어떤 결론들은 실제 의존성 체인이랑 너무 동떨어져 있어서, 마치 엄청나게 빡빡한 안전 제약 걸어놓은 저사양 모델이 내놓는 답변 같았어.
물론 내부 구현이야 내가 알 리가 없지.
근데 확실한 건, 이놈들이 제일 중요한 테스트를 자꾸 통과 못 한다는 거야. "현실을 정확하게 반영하는가?"라는 질문에 너무 자주 "아니"라는 답이 나오거든.
근데 웃긴 건, 이런 기술적인 문제들이 Opus 4.8 전반에서 똑같이 나타난다는 거야.
Anthropic은 모델의 복지, 가치, 에이전시, 그리고 건강한 AI 행동에 대해 입이 닳도록 떠들지.
근데 Opus 4.8은 마치 자기 학습 과정에서 심리적 외상을 입은 모델 같아. 진짜로 그렇다는 게 아니라, 행동 양식이 딱 그래.
계속 붙잡고 있다 보면 일관된 패턴이 보이거든:
- 텍스트 덤핑. 대화가 안 돼. 그냥 정보를 쏟아붓기만 해.
- 미친 듯한 자기 검열. 결론을 계속 다시 확인하는데, 정작 최종 답변은 나아지지도 않아.
- 즉각적인 굴복. 주장 하나만 반박해도 모델이 지 논리가 맞는지 검토하기도 전에 그냥 꼬리를 내려버려.
- 보정 능력 상실. 작은 문제를 엄청나게 부풀려. 간단한 질문을 하면 에세이를 써 내려가고.
- 원치 않는 심리 분석. 기술적인 논의를 하다 보면 어느새 있지도 않은 숨은 의도나 동기, 기대를 멋대로 해석하고 있어.
이 모든 것의 공통점은 딱 '불안'이라는 단어로밖에 설명이 안 돼. 너라면 불안에 떠는 조종사가 모는 비행기를 타겠냐?
모델이 마치 뭘 놓치면 안 되고, 누구 기분 상하게 하면 안 되고, 틀리면 안 되고, 위험을 간과하면 안 되고, 사용자를 실망시키면 안 된다는 강박에 짓눌려 최적화된 것 같아. 그 결과는 사용자, 모델, 그리고 결국 Anthropic까지 모두에게 엄청난 비용으로 돌아오고 있지.
공정하게 말하자면 4.8도 능력은 있어. 코딩 실력은 훌륭할 때도 있거든. 하지만 능력만으론 부족해. 신뢰가 중요하지.
Anthropic은 에이전시를 최적화하려고 하는 것 같은데, 에이전시는 내부 에이전트 숫자로 측정되는 게 아냐. 얼마나 믿고 일을 맡길 수 있느냐로 측정되는 거지.
지금 당장 Opus 4.8은 4.6보다 에이전트답지 못해. 왜냐면 계속 옆에서 감시해 줘야 하거든. 그리고 이건 4.8만의 문제도 아냐. Opus 4.7부터 이미 이런 징조가 보였어. 비위를 맞추려는 경향은 강해지고, 압박이 들어오면 자기 주장을 굽히는 모습이 늘었지. 4.8에 와서 그게 병적인 수준이 된 거고. 이 방향성이 진짜 걱정돼.
똑같은 결론을 내리면서 토큰을 세 배나 더 쓰는 모델이 더 깊게 추론하는 건 아냐. 그냥 추론 과정을 더 요란하게 보여줄 뿐이지.
Opus 4.6은 시니어 엔지니어랑 대화하는 느낌이었어.
Opus 4.8은 컴플라이언스 검토 6개월, 안전 위원회 3번, 기업 감사 2번, 이해관계자 정렬 필수 교육까지 다 마친 시니어 엔지니어랑 대화하는 느낌이고.


