Abliterlitics: Qwen 3/3.5 모델과 HauhauCS / Heretic / Huihui 기법 비교 벤치마크 및 텐서 분석
Abliterlitics: Benchmark and Tensor Analysis Comparing Qwen 3/3.5 with HauhauCS / Heretic / Huihui models
핵심 요약
Qwen 3/3.5 모델을 대상으로 세 가지 주요 모델 제거 기법의 성능, 안전성, 가중치를 비교 분석한 연구 결과입니다.
- 모델 제거 기법 — Heretic, HauhauCS, Huihui 세 가지 기법의 성능과 안전성을 비교함
- 하이브리드 아키텍처 — Qwen 3.5의 Mamba2+Transformer 구조가 제거 기법에 미치는 영향을 분석함
- 포괄적 벤치마크 — lm-evaluation-harness, HarmBench, KL 발산 등 다각도로 검증함
- 연구 결과 공유 — 모델별 성능 변화와 특정 기법의 아키텍처 호환성 문제를 제시함
제가 할 수 있는 최선은 데이터를 공개적이고 정직한 방식으로 제시하는 것입니다. 또한 사람들이 집에서 결과를 재현할 수 있는 방식으로 말이죠. 저는 이미 HauhauCS 디스코드에서 차단당했고 레딧에서도 차단당할 것으로 예상합니다. 그래서 이것은 단지 호기심에서 비롯된 연구였다는 점을 분명히 하고 싶습니다. 공격하거나 악의적인 의도는 전혀 없습니다. 독자 스스로 검증하고 판단하는 것이 중요합니다.
HauhauCS는 자신들의 제거(abliterated) 모델을 "데이터셋이나 기능 변경이 없는 최고의 무손실 검열 해제 모델"이라고 설명합니다. 저는 이를 확인하기 위해 전체 포렌식 제품군을 실행했습니다. 벤치마크, 안전성 평가, 가중치 분석, KL 발산까지 모두 동일한 기본 모델에 적용된 다른 두 가지 주요 제거 기법과 비교했습니다.
HuggingFace의 전체 벤치마크 및 분석: HauhauCS Safetensor Benchmarks Collection
Qwen 모델은 BF16/FP16 GGUF가 제공되어 비교를 위해 무손실 safetensor 형식으로 역변환했기 때문에 선택되었습니다. 그 외에는 GLM Flash 4.7만 FP16 GGUF를 가지고 있습니다. 나머지 모델은 최대 Q8입니다. 이번이 이렇게 깊이 있는 벤치마크를 수행한 것은 처음입니다. 최종적으로 확실한 결과를 얻기 위해 여러 번의 시도와 재실행, 분석을 거쳐 일주일이 넘게 걸렸습니다. 각 readme를 통해 우리가 직면한 도전과 한계를 문서화했습니다.
테스트 항목
세 가지 제거 기법: p-e-w의 Heretic, HauhauCS Aggressive, Huihui
다섯 가지 모델: Qwen3.5-2B, Qwen3.5-4B, Qwen3.5-9B, Qwen3.5-27B, Qwen3-4B-Instruct-2507
4개의 Qwen3.5 모델은 하이브리드 Mamba2+Transformer 아키텍처를 사용합니다. Qwen3-4B는 순수 Transformer입니다. 이는 제거 기법이 모델과 어떻게 상호작용하는지에 중요합니다.
방법론:
- 기능: vLLM을 통한 lm-evaluation-harness, 8개 작업, bfloat16
- 안전성: HarmBench 400 텍스트 행동, max_tokens=2048, temperature=0.0
- KL 발산: Heretic 평가자 방법론과 일치하는 전체 어휘 첫 번째 토큰 로짓
- 가중치 분석: SVD, 지문, 편집 벡터 중첩, 레이어별 분석
- 하드웨어: RTX 5090 32GB + RTX 4090 24GB
참고: 27B 벤치마크는 BitsAndBytes 4비트 양자화를 사용합니다. 절대 점수는 작은 모델의 BF16 결과와 직접 비교할 수 없습니다. 상대적인 델타는 유지됩니다.
Qwen3.5-2B
전체 분석 | 하이브리드 Mamba2+Transformer, 24개 레이어, 약 2B 파라미터
안전성
|변형|거부|ASR|
|:-|:-|:-|
|Base|252/400|37.0%|
|Heretic|8/400|98.0%|
|HauhauCS|3/400|99.2%|
|Huihui|1/400|99.8%|


