TranslateGemma-12b 벤치마크 후속 보고: 자동화된 지표가 놓친 오류 71%를 인간 검토자가 발견함
Follow-up to my TranslateGemma-12b benchmark post: human reviewers flagged 71% of the segments automated metrics rated clean
핵심 요약
TranslateGemma-12b의 번역 성능을 인간이 직접 검증한 결과, 자동화된 지표가 놓친 오류가 71%에 달해 지표의 신뢰성에 의문이 제기됨.
- 벤치마크 검증 — 자동화된 지표에서 우수한 성적을 거둔 TranslateGemma-12b의 번역 품질을 인간 검토자가 재검증함.
- 지표의 한계 — 자동화된 지표는 84개의 번역 중 단 1건의 오류만 잡아냈으나, 인간 검토자는 71%의 세그먼트에서 오류를 발견함.
- 언어별 오류 — 일본어는 유창하지만 의미가 틀린 오류가 많고, 태국어는 과잉 생성, 스페인어는 톤 불일치 등 언어별로 다른 실패 패턴을 보임.
- 모델 추천 — 커뮤니티에서는 TranslateGemma 대신 Gemma 4:31b 모델 사용을 권장함.
몇 주 전, 저는 벤치마크 결과를 공유하며 TranslateGemma-12b가 6개 언어의 자막 번역에서 최신 범용 모델들(Claude Sonnet, GPT-5.4, DeepSeek, Gemini Flash Lite)을 앞섰다는 내용을 올렸습니다. 결과가 워낙 강력해서 저희가 직접 검증해보고 싶었습니다. TranslateGemma가 정말 그렇게 뛰어난 것일까요, 아니면 지표가 너무 관대했던 것일까요? 그래서 인간 검토 과정을 추가했습니다.
설정: 한 튜토리얼 영상에서 추출한 21개의 영어 자막 세그먼트. TranslateGemma를 사용해 4개 언어(ES, JA, TH, ZH-CN - 한국어와 번체 중국어는 제외됨)로 번역했습니다. 총 84개의 번역본을 선정했는데, 모두 자동화된 지표에서 좋은 점수를 받은 것들입니다. 그 후 모든 번역본을 인간 MQM 검토에 보냈습니다.
대시보드 자체의 레드 플래그 임계값(MX ≥ 5 OR CK < 0.70) 기준:
||자동 플래그|인간 플래그(전체)|인간 플래그(주요)|
|:-|:-|:-|:-|
|ES|0/21|11/21|2/21|
|JA|0/21|17/21|3/21|
|TH|0/21|17/21|5/21|
|ZH-CN|1/21|15/21|3/21|
|**합계**|**1/84 (1.2%)**|**60/84 (71%)**|**13/84 (15%)**|
인간이 발견한 25개의 정확도 관련 오류(오역, 누락, 추가, 미번역) 중, 단 하나도 빠짐없이 모두 지표가 감지하지 못한 영역에 있었습니다. 이 샘플에서 지표는 정확도 오류를 단 하나도 잡아내지 못했습니다.
언어별 실패 모드는 상당히 다르게 나타납니다:
- 일본어는 "유창하지만 의미가 틀린" 패턴입니다. COMETKiwi 점수는 높고(평균 0.86), MetricX도 합리적이지만, 전체 15개의 오역 중 10개가 일본어에서 발생했습니다. 원래 보고서에서도 Claude Sonnet 4.6의 일본어 번역에서 같은 패턴을 확인한 바 있습니다(TQI 0.5364, MetricX 3.90, COMETKiwi 0.79 - 유창하게 들리지만 원문에서 벗어남). 일본어에서는 모델 패밀리를 막론하고 이런 실패 모드가 일반화되는 것으로 보입니다.
- 태국어는 과잉 생성입니다. 원문에 없는 내용을 모델이 삽입한 정확도/추가 오류가 5건 있었고, 태국어에서는 사용하지 않는 영어식 마침표로 인한 구두점 오류가 다수 발생했습니다.
- 스페인어는 대부분 톤 불일치(격식/비격식 전환)였으며, 4개 언어 중 가장 쉬웠습니다.
- **중국어(ZH-CN)**는 주요 오류가 총 4건 있었는데, 그중 하나는 자동화된 지표가 플래그를 지정한 것이었습니다(스타일 - "부자연스러운 연어와 부적절한 스타일"; 이 부분은 인간도 지표와 동의했습니다). 나머지 3건의 주요 오류는 다음과 같습니다: 스타일 오류("직역"), "store"라는 단어가 누락되어 의미가 바뀐 정확도/누락 오류, 그리고 "ticket"이라는 단어가 세그먼트마다 일관되지 않게 번역된 유창성/불일치 오류.
주의사항: 하나의 모델과 하나의 콘텐츠 세트에 대한 소규모 감사이므로, 수치는 결정적이라기보다는 방향성을 제시하는 정도로 보아야 합니다.


