의료 기록 작성을 위한 8개 LLM 벤치마크 결과: 환각은 드물지만, 누락된 정보에 주의가 필요함.
I benchmarked 8 LLMs for medical scribing. Hallucinations were rare; omissions need attention.
핵심 요약
의료 기록 작성용 LLM 8종을 벤치마크한 결과, 환각보다 정보 누락이 훨씬 빈번하게 발생함을 확인했습니다.
- 벤치마크 결과 — 의료 기록 작성 시 환각보다 정보 누락이 더 큰 문제로 확인됨.
- 모델별 성능 — GPT-5.4-mini는 효율적이며, Claude와 DeepSeek은 문장 품질이 우수함.
- 안전성 보완 — 정보 누락을 방지하기 위해 안전 계층(safety layer)을 결합한 파이프라인 구축이 유망함.
- 향후 계획 — 로컬 모델을 대상으로 동일한 평가를 진행할 예정임.
의료 기록 작성을 위한 LLM 벤치마크를 간단히 수행했습니다.
이유: AI 의료 기록 작성의 안전성에 관한 논의는 대부분 환각에 집중되어 있습니다. 그것도 중요하지만, 기록을 살펴보니 다른 문제가 보였습니다. 모델들이 대화에서 임상적으로 중요한 세부 사항을 자주 누락한다는 점입니다.
그래서 8개의 최첨단 모델을 300개의 합성 의사-환자 대화로 평가했습니다.
각 모델은 모든 대화에 대해 SOAP 노트를 작성했습니다. 그 후 4개의 모델로 구성된 심사위원단이 다음 항목에 대해 점수를 매겼습니다.
- 문장 품질
- 환각
- 누락된 안전 관련 사실
- 비용
- 속도
주요 결과:
2,400개의 생성된 노트에서 모델들은 다음을 기록했습니다.
- 12건의 확인된 고영향 환각
- 520건의 누락된 안전 관련 사실
즉, 이번 벤치마크에서는 환각보다 누락이 훨씬 더 흔했습니다.
그 외 눈에 띄는 점들:
- GPT-5.4-mini는 비용과 속도 대비 매우 우수한 성능을 보였습니다.
- Claude Sonnet과 DeepSeek은 문장 품질 면에서 가장 강력했습니다.
- DeepSeek은 저렴하고 글을 잘 썼지만, 많은 안전 관련 사실을 놓쳤습니다.
- 모델 크기가 크다고 무조건 좋은 것은 아니었습니다. Claude Opus는 누락이 가장 적었지만, 문장 품질은 다소 떨어졌습니다.
- Kimi는 확인된 환각이 0건이었으나, 이번 설정에서는 느리고 비쌌습니다.
레포에는 대화록, 출력물, 채점 스크립트, 리더보드가 포함되어 있습니다(링크는 댓글 참조).
다음으로 관심 있는 것은 로컬에서 실행 가능한 모델들에 대해 동일한 평가를 수행하는 것입니다.
별도로, 우리는 이 벤치마크를 제품 개발에 내부적으로도 사용했습니다. 당연한 후속 질문은 이것이었습니다: 저렴하거나 오픈 소스인 모델이 글은 잘 쓰지만 안전 관련 사실을 놓친다면, 대화록 기반의 래퍼(wrapper)가 그러한 누락을 복구하고 지원되지 않는 주장을 표시할 수 있을까?

