소개: DNR-Bench (응답하지 마시오 벤치마크)
Introducing: DNR-Bench: Do-not-respond Benchmark
핵심 요약
LLM이 아무런 응답도 하지 않도록 유도하는 'DNR-Bench' 벤치마크가 공개되어 화제입니다.
- 벤치마크 목적 — LLM이 아무런 토큰도 생성하지 않고 침묵을 유지할 수 있는지 테스트함.
- 테스트 결과 — GPT, Claude, Gemini 등 주요 모델 모두 0% 성공률을 기록함.
- 평가 기준 — 추론 토큰을 포함해 어떤 토큰이라도 생성하면 실패로 간주함.


