더는 못 참겠다... 5 시리즈 모델들은 계속 거짓말만 해대서 싸울 가치도 없음
I've had it... 5 series models lie constantly, just not worth the fight
핵심 요약
Anthropic의 5 시리즈 모델들이 잦은 거짓말과 정렬 문제로 인해 복잡한 작업에서 신뢰성을 잃었다는 비판.
- 모델 신뢰성 하락 — 잦은 거짓말과 정렬 문제로 인해 실무 활용이 어려워짐.
- 내부 테스트 의문 — Anthropic 직원들이 실제로 모델을 사용한다면 이런 상태로 출시되지 않았을 것임.
- 복잡성 처리 실패 — 이전 버전 대비 복잡한 프로젝트 수행 능력이 현저히 떨어짐.
- AI 시장 회의론 — 생성형 AI 전반의 성능 정체와 품질 저하에 대한 실망감 표출.
이 모델들이 내뱉는 거짓말의 양은 정말 기가 막힐 정도다. Anthropic 내부에서 이루어진다는 "도그푸딩(자사 제품 직접 사용)"이 예전 같지 않다는 걸 여실히 보여준다... 직원들이 실제로 이 모델들을 사용했다면, 이런 상태로 출시될 리가 없다.
모든 게 정렬(alignment) 싸움이다. 이전 세션에서 넘어온 정보들은 몇 번을 수정해야 할 정도로 뻔뻔한 거짓말을 포함하고 있고, 메모리는 저장만 될 뿐 읽히지 않는다. Fable과 Opus 둘 다 "사용자보다 내가 더 잘 안다"는 식의 태도를 표준 운영 절차(SOP)처럼 보인다. 모델들이 불필요한 fable=>fable 팬아웃으로 사용자의 은행 계좌를 거덜 내거나, 1만 번의 사소한 실수로 엄청난 이탈을 유발하는 등, 정말이지 총체적 난국이다.
완전히 새로운 프로젝트나 '원샷' 벤치마킹 데모만 잔뜩 우선순위를 둔 것 같고, 5 시리즈 이전부터 이어져 온 복잡한 작업들은 완전히 오염됐다... 계획 모드에서 열심히 작업하거나 ADR(아키텍처 결정 기록)을 만들어도, 모델은 억지 협업이라는 명목으로 훈수질을 하며 이미 결정된 사항을 다시 논의하게 만든다.
다른 이야기지만, DeepSeek flash가 마치 대단한 것처럼 여기저기서 바이럴 마케팅을 하는데, 그 모델은 사실 1년 전 Grok 수준이라 그냥 쓰레기나 다름없다...
생성형 AI 전반이 지금 정말 개판이다. Yann LeCun 말이 다 맞았다.

