왜 우리는 양자화 모델을 perplexity와 문장력으로만 평가하고, 도구 호출(tool call) 유효성은 평가하지 않을까?
Why do we benchmark quants on perplexity and prose but never on tool call validity?
핵심 요약
양자화 모델의 성능 평가 지표로 perplexity 외에 도구 호출 유효성 검증이 필요하다는 논의입니다.
- 평가 지표의 한계 — perplexity와 문장력은 양자화 영향을 덜 받지만 도구 호출은 치명적일 수 있음
- 구조화된 출력 문제 — JSON 형식이나 스키마 준수 능력이 양자화 시 더 빨리 저하되는 경향이 있음
- 재시도 메커니즘의 함정 — 자동 재시도 기능이 도구 호출 실패를 숨겨 실제 오류율을 과소평가하게 만듦
- 채팅 템플릿의 영향 — 도구 호출 오류가 양자화 탓인지 템플릿 문제인지 구분하기 어려운 경우가 많음
최근 이곳에서 논의되는 혼합 정밀도 양자화, 공유 전문가 모델과 에지 레이어를 더 높은 정밀도로 유지하는 MoE 관련 기술들은 훌륭하지만, 거의 모든 평가가 perplexity와 일반적인 출력 품질을 기준으로 측정됩니다. 제가 전혀 보지 못한 것은 구조화된 출력입니다. 도구 호출 JSON, 함수 스키마, 제약된 형식 같은 것들이죠.
제 직관으로는, 틀렸으면 좋겠지만, 그런 것들이 문장력보다 더 빨리 저하된다고 생각합니다. Q4_K_M 수준의 모델은 완벽하게 읽을 수 있는 문단을 작성하면서도, 괄호를 하나 빼먹거나 존재하지 않는 필드명을 환각으로 만들어내는 JSON을 조용히 생성할 수 있습니다. 문장력은 각 토큰마다 유효한 연속 문장이 많지만, 스키마는 거의 없거든요. 그래서 텍스트에서는 보이지 않는 똑같은 양자화 오류가 도구 호출에서는 치명적인 결과를 낳습니다.
만약 그렇다면, 에이전트 용도로 사용할 때 실제로 감당할 수 있는 양자화 수준은 perplexity 차트가 제안하는 것보다 낮으며, 많은 사람이 잘못된 지표를 기준으로 양자화를 선택하고 있는 셈입니다. 혹시 한 모델을 대상으로 양자화 수준 전반에 걸쳐 도구 호출 유효성 성공률을 벤치마크해 본 사람 있나요? perplexity 말고, 그냥 JSON 파싱만 해본 경우 말입니다.


