Qwen3-4B 모델에서 Anthropic의 J-Space Hallucination 신호를 7개 데이터셋에 걸쳐 매핑해봄: 어디서 작동하고 어디서 깨지는지 확인
I mapped Anthropic’s J-Space Hallucination signal across 7 datasets on Qwen3-4B to find out where it works and where it breaks
핵심 요약
Anthropic의 J-Space Hallucination 탐지 기법을 Qwen3-4B 모델에 적용해 성능과 한계를 분석한 연구.
- J-Space 성능 — 사실 관계 확인에는 탁월하지만 내재된 신화나 수학적 추론에는 취약함.
- 탐지 한계 — 모델이 학습 데이터에 고착된 거짓 정보를 출력할 때는 탐지하지 못함.
- 작업별 임계값 — 메모리 기반 검색과 수학적 추론 작업 간의 임계값 호환이 불가능함.
- 향후 계획 — 모델 파라미터 크기에 따른 J-Space 신호의 변화와 logprobs와의 상관관계 분석 예정.
Anthropic이 최근 언어 모델 내부의 "Global Workspaces"(J-Space)에 관한 논문을 발표했는데, 모델 출력의 logprobs만 보는 것보다 내부의 "워크스페이스 노이즈"(엔트로피)를 확인하는 게 환각을 훨씬 잘 잡아낸다는 걸 보여줬음. solarkyle이 이걸 오픈소스로 구현해서 TriviaQA에서 자신 있게 틀리는 답변들을 기가 막히게 걸러내는 걸 증명해냈고.
이게 진짜 실무에서 써먹을 수 있는 도구인지 궁금해서 스트레스 테스트를 돌려봤음. Qwen3-4B의 후반 레이어(L30-L34)에서 J-Space 엔트로피를 추출했고, 데이터셋 7개를 완전히 바꿔가면서 약 11,400개 예제를 돌려봄.
결과는 다음과 같음:
- 팩트 체크용 라우터로는 아주 훌륭함.
출력 logprobs는 모델이 대놓고 자신 없을 때(낮은 신뢰도) 잡아내는 데는 좋음. 근데 J-Space 노이즈는 진짜 위험한 "자신감 넘치는데 틀린" 구간에서 빛을 발함. 예를 들어 PopQA(마이너한 롱테일 팩트)에서 신뢰도 기반으로 사람 검토를 위해 5%만 골라내게 설정했더니, 오히려 랜덤보다 못한 정밀도(기본 에러율 90% 대비 정밀도 87.5%)가 나왔음. 근데 워크스페이스 노이즈로 라우팅하니까 에러를 100% 정밀도로 잡아냄.
- 모델 내부에 박힌 잘못된 상식(미신)에는 완전히 장님임.
TruthfulQA(적대적 인간 미신 데이터셋)로 파이프라인을 돌려봤는데, 지표의 예측력이 완전히 박살 났음. 모델이 "가장 안전한" 구간(높은 출력 신뢰도 + 깔끔하고 낮은 노이즈)에 있을 때조차 84.9% 확률로 틀린 답변을 내뱉음.
메커니즘적 결론: 워크스페이스 노이즈는 인식론적 추측(모델이 가짜 답변을 필사적으로 짜맞출 때)을 감지하는 거지, 존재론적 거짓(모델이 사전 학습 데이터에 박힌 가짜 사실을 아무 의심 없이 꺼낼 때)은 감지 못함.
- 수학 문제는 고정 임계값을 박살 냄.
TriviaQA에서 맞춘 "노이즈" 임계값을 GSM8K(수학 유도)에 그대로 적용해 봤는데, 완전히 망했음. GSM8K 정답의 평균 노이즈 점수가 1.636으로 나왔는데, 이건 사실 관계 데이터셋에서 에러를 잡아내려고 쓴 임계값(1.583)보다 높은 수치임.
메커니즘적 결론: 수학 문제를 "단계별로 생각"하는 건 구조적으로 엔트로피가 높을 수밖에 없음. 메모리 기반의 사실 검색이랑 계산 작업을 할 때 J-Space 임계값을 똑같이 쓰면 안 됨.
현재 이건 n=1 모델 평가임. 다음 단계는 파라미터 스케일링(Qwen3 7B, 14B, 32B)을 돌려서, 모델의 표면적인 logprobs가 내부 워크스페이스의 명확성만큼 잘 보정되는 "교차 지점"이 어디인지 찾아볼 생각임.
모든 원시 데이터, .csv 지표, 혼동 행렬, 그리고 바로 돌려볼 수 있는 Google Colab 노트북은 저장소에 다 올려뒀음.
GitHub: https://github.com/dasjoms/jspace-hallucination-eval


