LMArena 텍스트 리더보드에 새로운 '사실성' 지표 도입 후 Opus 4.6이 1위 등극
Opus 4.6 rises to no #1 on the LMArena Text Leaderboard after they introduce a new "Factuality" rating/factor
핵심 요약
LMArena가 사실성 지표를 도입하자 Claude Opus 4.6이 1위를 차지하며 모델 신뢰성을 입증함.
- 사실성 지표 도입 — LMArena가 인간 선호도와 사실성을 결합한 새로운 랭킹 시스템을 공개함.
- Opus 4.6 1위 등극 — 사실성 가중치를 적용하자 Claude Opus 4.6이 텍스트 리더보드 전체 1위를 차지함.
- 모델별 순위 변동 — GPT-5.5는 13계단 상승하며 선전한 반면, Muse Spark는 사실성 부족으로 순위가 급락함.
- 사용자 경험 증명 — Opus 4.6이 최신 모델보다 더 신뢰할 수 있다는 유저들의 체감이 데이터로 확인됨.
아레나에 사실성(Factuality) 지표 도입
인간의 선호도와 사실성을 가중치로 결합한 새로운 모델 순위가 공개되었습니다.
이제 이 결합 점수를 통해 모델 순위를 확인할 수 있습니다. 사실성 지표는 **텍스트 아레나(Text Arena)**와 검색 아레나(Search Arena) 모두에서 비기본 설정 토글로 활성화할 수 있습니다.
사실성 측정 방법
다음 과정을 통해 모델의 응답을 검증합니다:
- 무작위로 아레나 배틀을 샘플링합니다.
- 각 응답에서 웹 검증 가능한 주장을 추출합니다.
- 해당 주장들을 검증합니다.
- 경쟁 모델 응답 간의 평균 정확도를 비교합니다.
이 순위를 산출하기 위해, 실제 대화에서 LLM이 내뱉은 200만 개 이상의 주장에 라벨을 지정했습니다:
-
텍스트 아레나에서 130만 개 이상의 주장
-
검색 아레나에서 70만 개 이상의 주장
텍스트 아레나 주요 내용 (사실성 활성화 시)
-
Claude Fable 5가 약간 하락하여 2위가 되었습니다.
-
GPT-5.5가 가장 큰 개선을 보이며 13계단 상승해 7위를 기록했습니다.
-
Muse Spark가 가장 큰 하락을 겪으며 7위에서 20위로 떨어졌습니다 (−13계단).
검색 아레나 주요 내용
-
GPT-5.5-search가 한 계단 상승하여 사실성 리더보드 1위를 차지했습니다.
-
GPT-5.2-search가 가장 큰 폭으로 상승한 모델 중 하나로, 11위에서 3위로 뛰어올랐습니다.

