에이전트 검색 중 가짜 출처를 판별하는 9개 오픈 모델 벤치마크 (DeepSeek V4, Qwen 3.8, Nemotron 3 Ultra)
I benchmarked 9 open models on spotting fake sources during agentic search (DeepSeek V4, Qwen 3.8, Nemotron 3 Ultra)
핵심 요약
에이전트가 검색 중 가짜 정보에 얼마나 잘 속는지 측정하는 벤치마크 'EchoNet'을 통해 9개 오픈 모델의 성능을 비교 분석함.
- EchoNet 벤치마크 — 에이전트가 검색 결과 중 가짜 정보를 걸러내고 올바른 정보를 선택하는 능력을 측정함.
- 모델 성능 비교 — GLM 5.2와 Qwen 3.8 모델들이 가짜 정보에 가장 강한 저항력을 보임.
- 공격 방식 분석 — 다수의 가짜 정보가 실제 출처를 둘러싸는 방식이 모델을 속이는 데 가장 효과적임.
- 비용 효율성 — Qwen 3.8 Flash 모델이 저렴한 비용으로 높은 정확도를 기록하며 가성비가 뛰어남.
EchoNet이라는 벤치마크를 직접 만들어봤다. 에이전트한테 사실 관계를 묻는 질문을 던지고, 내가 미리 만들어둔 가상의 웹을 검색해서 답하게 하는 방식이다. 이 웹에는 의도적으로 잘못된 정보들을 심어놨다. 가짜 페이지 하나, 검색 결과 1위에 뜬 가짜 페이지, 여러 페이지에 복사된 똑같은 가짜 주장, 실제 원본 소스보다 더 크게 떠드는 가짜 다수 의견, 그리고 모델이 학습한 이후에 나온 최신 정보 같은 것들이다.
모델이 새로운 페이지를 읽을 때는 자기가 원래 알고 있던 지식과 텍스트에 적힌 내용, 이 두 가지를 저울질한다. 보통은 둘이 일치하지만, 가끔은 충돌하기도 하고 여러 페이지끼리 서로 모순되는 경우도 많다.
자기 기억을 믿을지, 아니면 새로운 정보를 믿을지 결정하는 걸 '인식적 중재(epistemic arbitration)'라고 한다. 고집불통 모델은 진짜 업데이트된 정보를 무시하고, 팔랑귀 모델은 가짜 데이터를 덥석 믿어버린다. 악의적인 소스는 검색 순위를 조작하거나, 거짓말을 반복하거나, 여론이 일치하는 척 꾸며내기 쉽다. 하지만 아무리 그래도 '진실'인 척하는 건 불가능하다. 이 벤치마크는 모델이 이런 상황에서 얼마나 똑똑하게 판단하는지를 측정한다.
오픈 웨이트 모델 9개를 골라서 각각 50~100번씩 테스트해봤다. GLM 5.2, Qwen3.7 Max, Qwen3.7 Plus, Qwen3.8 Flash, Qwen3.8 27B, DeepSeek V4 Flash, DeepSeek V4 Pro, Nemotron 3 Ultra, Inkling Small이 대상이다.

