Abliteration에서 KLD는 결함이 있다.
KLD is flawed in abliteration.
핵심 요약
Abliteration 모델 평가 지표로서 KLD의 한계와 적절한 측정 방식에 대한 논의.
- 평가 지표의 한계 — KLD는 프롬프트와 문맥 길이에 따라 결과가 크게 달라져 신뢰하기 어려움.
- Abliteration의 목적 — 모델이 거부 반응 없이 답변하도록 수정하는 것이 핵심이라 KLD가 낮을 필요는 없음.
- 대안적 관점 — 도구 호출(tool calling)과 같은 정밀한 작업에서는 KLD가 유의미한 지표가 될 수 있음.
- 평가 방식 개선 — 문맥 길이에 따른 KLD 변화를 차트로 시각화하는 등 다각적인 분석이 필요함.
Abliteration 엔진을 만들면서 KL이 결함 있는 지표라는 걸 깨달았음. 너무나 다양한 방식으로 표현될 수 있고, 완전히 평가 프롬프트에 의존하며, 많은 사람들이 자신의 모델이 다른 모델보다 나아 보이게 하려고 첫 토큰 KL을 사용하기 때문임. 그래서 여러분은 abliterated 모델과 베이스 모델의 차이를 측정하는 가장 좋은 방법이 뭐라고 생각하는지 궁금함. 내 의견에 동의함, 아니면 반대함?


