Grok 4.6에서 가장 중요한 수치는 xAI가 홍보조차 하지 않은 것이다
Grok 4.6's most important number is one xAI didn't even advertise
핵심 요약
Grok 4.6은 환각을 줄이고 모를 때 모른다고 답하는 능력이 크게 향상되어, 에이전트 작업의 신뢰성이 높아졌습니다.
- 환각 방지 능력 — Grok 4.6은 모르는 질문에 대해 '모른다'고 답하는 비율이 65.7%로 대폭 상승함
- 에이전트 신뢰성 — 잘못된 전제로 작업을 수행하는 오류를 줄여 긴 작업 흐름에서 더 안정적임
- 벤치마크 비교 — 코딩 및 지능 지수는 경쟁 모델과 비슷하지만, 불확실성을 인정하는 태도에서 차별화됨
- 실무적 조언 — 모델의 답변을 맹신하지 말고 작업을 세분화하여 단계별로 검증하는 방식이 권장됨
어제 Grok 4.6이 나왔는데, 다들 "Sol보다 나은가?" 가지고 또 싸우고 있네. 헤드라인 벤치마크만 보면 진짜 비등비등함: Intelligence Index 61 대 61, 코딩 76.8 대 77.4, Agentic 58.7 대 57.8.
근데 아무도 스크린샷 안 찍어 올리는 수치가 하나 있는데, 바로 AA-Omniscience의 '환각 없는 비율(Non-Hallucination Rate)'임. 정의는 이거임: 모델이 정답을 못 맞혔을 때, 그냥 아무 말이나 지어내는 대신 "모르겠다"고 답하는 비율이 얼마나 되냐는 거.
- GPT-5.6 Sol: 7.8% (모를 때 92% 확률로 구라 침)
- GPT-5.6 Terra: 12.1%
- GPT-5.6 Luna: 7.4%
- Grok 4.5: 45.9%
- Grok 4.6: 65.7%
45.9에서 65.7로 뛴 건 이번 보드에서 가장 큰 캘리브레이션 개선인데, xAI 출시 글에는 언급조차 없음. 제3자들이 데이터 파헤치다가 찾아낸 거임.
내가 코딩 지수 몇 점 차이보다 이게 훨씬 중요하다고 생각하는 이유는, 에이전트 코딩은 의사결정의 연속이라 에러가 계속 쌓이기 때문임(단계별 신뢰도 95%라고 치면 10단계에서 성공률 60%, 20단계에선 36%로 떡락함). 멈출 줄 모르고 자신 있게 헛소리하는 모델은 눈에 띄는 실패를 안 함. 대신 잘못된 전제로 완벽하게 빌드를 돌려버리고, 툴 호출 40번 다 하고 나서야 "아차" 싶게 만듦. 아이러니하게도 OpenAI가 낸 "Why Language Models Hallucinate" 논문에서도 똑같은 소리 함. 모델들이 평가 지표 때문에 모른다고 말하기보다 찍기를 선택하게 된다고.
실제로 GPT 모델들 써보면 딱 이 느낌임: 능력은 개쩌는데, 계획을 일일이 다 짜줘야 하고 결정할 때마다 옆에서 감시해야 함. 왜냐? 이 새끼들은 죽어도 "잘 모르겠는데요"라는 말을 안 하거든.
물론 가장 어려운 에이전트 벤치마크(DeepSWE 73 대 65.9, Terminal-Bench Hard 등)에선 여전히 Sol이 이김. 기권 비율은 그냥 다 거절해버리면 수치가 왜곡될 수 있으니까(그래서 AA가 정확도랑 같이 보는 거임; Grok 4.6은 정확도 48.2%라 쫄아서 숨기는 건 아님) 벤치마크 기권율이 작업 중 행동을 100% 대변하는 건 아님. 하지만 가격은 $2/$6 대 $5/$30인데 지능은 비슷하고, 모르는 걸 인정하는 태도는 8배나 차이 난다면? 나라면 어떤 놈한테 무인으로 일 맡길지 답 딱 나오지.


