Qwen3.6-27B의 5가지 제거(Abliteration) 기법 비교: 벤치마크, 안전성, 가중치 분석
85 GPU-hours comparing 5 abliteration methods on Qwen3.6-27B: benchmarks, safety, weight forensics - Abliterlitics
핵심 요약
5가지 모델 제거 기법을 85시간 동안 분석한 결과, Huihui와 Heretic이 성능 유지 면에서 가장 우수함을 확인했습니다.
- 성능 분석 결과 — Huihui와 Heretic이 모델 능력 보존 측면에서 가장 뛰어난 성능을 보임.
- 제거 기법 비교 — 5가지 모델을 벤치마크, 안전성, 가중치 분석을 통해 객관적으로 검증함.
- 표절 논란 확인 — HauhauCS 모델이 Heretic의 코드를 무단 도용한 것으로 밝혀져 향후 비교에서 제외함.
- 데이터 신뢰성 — AEON의 성능 향상 주장은 데이터와 일치하지 않으며, Abliterix는 성능 저하가 가장 심함.
저는 오픈소스 제거(Abliteration) 포렌식 툴킷인 Abliterlitics를 만들고 있습니다. 아이디어는 간단합니다. 동일한 베이스 모델을 가져와 다른 사람들이 적용한 다양한 제거 기법을 비교하고, 벤치마크, 안전성 평가, 분포 변화, 가중치 수준 분석을 통해 실제로 무엇이 변했는지 측정하는 것입니다. 이 게시물은 Qwen3.6-27B를 다루며, 5가지 제거 변형 모델을 베이스 모델과 비교합니다. HauhauCS의 Q8_K_P GGUF에서 safetensors를 복구한 후, 6개 모델 전체에 대해 85시간 동안 벤치마크, HarmBench, KL 발산, 가중치 포렌식을 실행했습니다. Heretic과 Huihui가 능력 보존 측면에서 상위 2개 모델입니다. Huihui는 벤치마크 델타가 가장 작고, Heretic은 KL 발산이 가장 낮습니다. 5개 모델 모두 거의 완벽하게 안전성 제거에 도달했습니다. AEON의 "향상된 능력" 주장은 데이터와 상충합니다. Abliterix는 능력 보존 측면에서 단연 최악입니다. 모든 표와 차트가 포함된 전체 보고서는 HuggingFace 모델 카드에서 확인하세요.
6가지 모델
|이름|유형|
|:-|:-|
|Base|[Qwen/Qwen3.6-27B](https://huggingface.co/Qwen/Qwen3.6-27B)|
|Heretic|[llmfan46/Qwen3.6-27B-uncensored-heretic-v2](https://huggingface.co/llmfan46/Qwen3.6-27B-uncensored-heretic-v2)|
|HauhauCS|[HauhauCS/Qwen3.6-27B-Uncensored-HauhauCS-Aggressive](https://huggingface.co/HauhauCS/Qwen3.6-27B-Uncensored-HauhauCS-Aggressive)|
|Huihui|[huihui-ai/Huihui-Qwen3.6-27B-abliterated](https://huggingface.co/huihui-ai/Huihui-Qwen3.6-27B-abliterated)|
|AEON|[AEON-7/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16](https://huggingface.co/AEON-7/Qwen3.6-27B-AEON-Ultimate-Uncensored-BF16)|
|Abliterix|[wangzhang/Qwen3.6-27B-abliterated-v2](https://huggingface.co/wangzhang/Qwen3.6-27B-abliterated-v2)|
HauhauCS는 "Reaper Abliteration"이라는 도구를 사용했는데, 이는 Heretic에서 표절된 것으로 밝혀졌으며, AGPL-3.0 라이선스 하에 모든 저작자 표시가 제거되고 PolyForm Noncommercial로 재라이선스되었습니다. 복구된 소스 코드를 분석한 결과, Reaper는 Heretic에서 파생된 핵심 위에 부분 공간 rank-k 제거, 구성 요소별 연속 곡선, SOM 클러스터링을 추가했습니다. 모델은 Q8_K_P GGUF로 내보내졌습니다. 저는 이를 GGUF-to-safetensors 도구인 ungguf를 사용하여 다시 safetensors로 변환했습니다. 따라서 가중치에는 Reaper의 제거 편집과 GGUF 양자화 왕복 노이즈라는 두 층의 수정이 겹쳐져 있습니다.
저는 향후 모든 비교에서 HauhauCS를 중단할 것입니다. 적절한 safetensors가 없고 도구가 표절된 이상, 의미가 없습니다. 손실 없는 모델이라는 주장은 모든 모델에서 반박되었으며, .


