Claude Opus 4.6, BridgeBench 환각 테스트 정확도 83%에서 68%로 급락
Claude Opus 4.6 accuracy on BridgeBench hallucination test drops from 83% to 68%
핵심 요약
Claude Opus 4.6의 환각 테스트 성능이 15%p 하락하며 사용자들 사이에서 모델 성능 저하 논란이 일고 있습니다.
- 성능 저하 논란 — BridgeBench 테스트 결과 환각 수치가 83%에서 68%로 급락함.
- 사용자 체감 — 많은 사용자가 모델이 이전보다 멍청해지고 틀린 답을 확신 있게 말한다고 느낌.
- 양자화 의혹 — 비용 절감을 위해 모델을 과도하게 양자화한 것이 원인일 수 있다는 추측이 제기됨.
- 신뢰성 문제 — 기업용 서비스 등 고위험 분야에서 Claude의 안전성 이미지에 타격이 예상됨.
Anthropic의 주력 모델이 가장 중요한 AI 벤치마크 중 하나에서 상당한 정확도 타격을 입었습니다.
상황은 이렇습니다: Claude Opus 4.6이 최근 BridgeBench에서 테스트를 받았는데, 이 벤치마크는 AI 모델이 얼마나 자주 거짓 정보를 생성하는지(환각)를 측정합니다. 모델의 정확도는 83%에서 68%로 떨어졌습니다. 이는 15%p나 급락한 수치로, HackerNews에서도 화제가 되고 있습니다.
참고로, 환각 벤치마크는 모델이 내놓는 답변을 실제로 신뢰할 수 있는지 측정하기 때문에 매우 중요합니다. 자신 있게 틀린 사실을 지어내는 AI는 모르는 것을 모른다고 인정하는 AI보다 훨씬 위험할 수 있습니다.
여기서 주목할 만한 몇 가지 포인트가 있습니다 🤔
첫째, 버전이 올라간다고 해서 모든 면에서 개선되는 것은 아닙니다. 모델은 종종 특정 부분에서 성능이 향상되지만 다른 부분에서는 조용히 퇴보하기도 합니다. 이번 사례는 그 트레이드오프를 보여주는 전형적인 예시로 보입니다.
둘째, 68%도 여전히 통과 수준이긴 하지만, 법률 조사, 의료 정보, 금융 분석과 같은 기업용 사례를 고려하면 83%와의 격차는 실무에서 엄청나게 크게 느껴집니다.
셋째, Anthropic은 Claude를 '안전 제일' 모델 제품군으로 포지셔닝해 왔기 때문에, 성능 중심의 경쟁사에서 이런 일이 발생했을 때보다 환각 퇴보가 훨씬 더 뼈아프게 다가옵니다.
벤치마크가 전부는 아닐 수 있습니다. BridgeBench 자체의 한계도 있고 실제 현장에서의 영향은 다를 수 있습니다. 하지만 무시하기 어려운 데이터 포인트인 것은 분명합니다.
제가 정말 궁금한 점은, 사용자들이 일상적인 사용에서 이런 종류의 퇴보를 실제로 체감할 수 있을지, 아니면 고위험 전문 분야에서만 문제가 되는 것인지입니다.


