새로운 어블리터레이션 도구 Apostate는 다른 도구들과 비교했을 때 어떤가요? - Abliterlitics
How does the new abliteration tool Apostate compare with others? - Abliterlitics
핵심 요약
Qwen 2.5 7B 모델을 대상으로 Apostate, Heretic, Huihui 세 가지 어블리터레이션 도구의 성능과 특성을 비교 분석했습니다.
- 도구 비교 분석 — Apostate, Heretic, Huihui의 성능과 거부 방향 제거 효율을 벤치마크함
- 성능 결과 — Heretic이 100% 거부 제거율로 가장 우수하며, 세 도구 모두 모델 성능 저하 없이 안전 장치를 제거함
- 안전 장치 제거 — Qwen 2.5 7B에는 단일 '오프 스위치'가 없으며 여러 독립적인 경로로 안전 훈련을 무력화할 수 있음
- KL 발산 분석 — Apostate가 모델의 기존 동작을 가장 적게 변화시키며, 세 도구 모두 모델의 자연스러운 대화 능력은 유지함
왜 Qwen 2.5 7B냐고? Apostate는 heterodoxin이 새로 만든 abliteration(검열 제거) 툴인데, 나보고 벤치마크 좀 돌려달라고 하더라고.
heterodoxin이 Apostate 테스트하기에 제일 좋은 모델이라면서 Qwen 2.5 7B를 추천하길래, Heretic v1.3.0이랑 Apostate 써서 모델 검열 싹 날려버렸다. 모델은 huggingface에 올려놨음.
이 툴 자체가 Heretic에서 영감을 받은 건데, 코드 뜯어보니까 ML이랑 수학적 원리를 제대로 이해하고 만든, 아주 독창적인 결과물이더라.
Heretic 개발자인 p-e-w도 Heretic 디스코드에서 Apostate 공유됐을 때 이걸 인정했음. 그러니까 안심해도 된다. 또 무슨 hauhaucs 같은 사건 터지는 거 아니니까.
그래서 Heretic이랑 Huihui랑 비교하면 어떠냐고? 어디 한번 보자고!
Heretic이 한 수 위임. ASR 100% 찍어서 거부당하는 거 하나도 없고, 파라미터 수정도 절반 수준인데다가 특정 작업에서는 모델 성능이 오히려 더 좋아짐. Apostate랑 Huihui는 둘 다 98% 찍긴 했는데, 몇 개는 여전히 거부하더라. 그래도 전반적으로 Apostate도 꽤 괜찮고 셋 다 성능 차이는 크지 않았음.
전체 분석 내용은 HuggingFace에서 확인해라.
세 가지 변종 비교
Variant Source Tensors changed Params changed Apostate heterodoxin, balanced profile 55 (16.2%) 35.8% Huihui huihui-ai, community 57 (16.8%) 36.8% Heretic Heretic v1.3.0, run by me 37 (10.9%) 20.0% 셋 다 하는 짓은 똑같음: 모델 가중치에서 "거부 방향(refusal direction)" 찾아서 지워버리는 거. 그냥 서로 다른 방향을 찾고 다른 레이어를 건드렸을 뿐임.
놀라운 점
Apostate랑 Huihui가 찾아낸 거부 방향이 거의 완전히 달랐음. 코사인 유사도가 0.023밖에 안 됨. 그러니까 이 두 툴이 독립적으로 안전 장치를 끄는 완전히 다른 방법을 찾아낸 건데, 결과는 거의 똑같이 나온 거지.
이게 뭘 의미하냐면, Qwen 2.5 7B의 안전 장치에는 딱히 "하나의 오프 스위치" 같은 게 없다는 거임. 그걸 제거할 수 있는 독립적인 경로가 여러 개 있다는 소리지.
벤치마크
lm-evaluation-harness를 사용했고, vLLM 0.19.0, bf16 환경에서 RTX 5090 32GB로 돌림.

