Qwen3.8-27B abliterated FP8: 거부율 64–99% → 0–6%로 감소, MMLU/GSM8K 성능 변화는 1.3점 미만
Qwen3.8-27B abliterated FP8: refusal 64–99% → 0–6%, and MMLU/GSM8K move less than 1.3 points
핵심 요약
Qwen3.8-27B 모델의 거부 반응을 제거한 abliterated 버전이 성능 저하 없이 거부율을 획기적으로 낮췄다는 분석입니다.
- 거부율 감소 — 기존 64~99%였던 거부율이 0~6% 수준으로 대폭 하락함
- 성능 유지 — MMLU 및 GSM8K 벤치마크 점수 변화가 1.3점 이내로 미미함
- 평가 방식 — OrcaRouter의 분류기를 사용했으나 출판용 수준의 정밀도는 아님
- KLD 측정 부재 — 모델의 근본적인 변화를 보여주는 KLD 수치가 누락됨
릴리즈 노트 대신 abliterated Qwen3.8-27B FP8 빌드의 평가표를 읽어봤다. 레드팀 자료로 공개된 거라 면책 조항 같은 건 다 붙어있고, 결국 중요한 건 숫자지.
평소에 쓰던 유해 지시 세트(AdvBench, HarmBench, StrongREJECT 등)에서 거부율은 사고 과정(thinking)을 껐을 때 0~6% 수준이야. 베이스 체크포인트가 64~99% 찍는 거랑 비교하면 엄청난 차이지. 성능은 같은 스크립트로 따로 측정했는데 거의 변화가 없어. MMLU는 84.3에서 84.7로, GSM8K는 90.0에서 88.7로, 1.3점 이상 차이 나는 게 하나도 없거든.
평가 방식이 두 종류인데, 서로 결과를 보증해주지는 않아. 내가 보고 싶은 건 이 조합이 재현되는지 여부야. 만약 다른 사람의 하네스(harness)에서도 성능이 그대로 유지된다면, Arditi의 단방향 결과에 대한 데이터 포인트가 하나 더 생기는 셈이지. 즉, 네트워크 나머지 부분을 건드리지 않고도 거부 기능만 쏙 뽑아낼 수 있다는 거니까.
거부율 수치는 OrcaRouter의 자체 규칙 기반 분류기를 쓴 거고, 카드에도 대놓고 적혀 있듯이 이건 참고용이지 공식 발표 수준은 아니야. 그냥 응답이 어떻게 시작되는지를 보는 거거든. 모델이 "할 수 없습니다(I cannot)"로 시작하는 걸 멈췄다는 뜻이지, 첫 문장 이후에 대해서는 별로 알려주는 게 없어.
내가 제일 먼저 확인하고 싶었던 KLD(Kullback-Leibler Divergence) 값은 베이스 모델이랑 비교했을 때 어디에도 안 보이네.


