Qwen 3.8 27B 언센서드 변형 8종 비교: 베이스 모델 1개, GPU 167시간 소요 - Abliterlitics
8 uncensored Qwen 3.8 27B variants, one base, 167 GPU hours - Abliterlitics
핵심 요약
Qwen 3.8 27B 모델의 8가지 언센서드 변형을 벤치마크하여 성능과 검열 해제 정도를 비교 분석함.
- 성능 비교 — 8개 변형 모델의 HarmBench ASR 및 모델 카드 정직성 검증함
- 방법론 — 가중치 비교, KL 발산 측정, 13개 벤치마크 및 HarmBench 400 활용
- 주요 발견 — 정교한 편집이 무차별적 편집보다 성능 유지에 훨씬 효과적임
- 문제점 — 일부 모델의 무한 사고 루프 현상 및 챗 템플릿의 행동 영향력 확인
몇몇 사람들이 요청해서 비교해 봤는데, 우리 모두 결과가 어떻게 나올지 엄청 궁금했거든. 비교하는 데만 11일 걸렸고, GPU는 약 167시간 동안 쉼 없이 돌아갔어.
허깅페이스에 올라온 여러 'abliterated(검열 해제)' 모델들이 진짜 광고하는 대로 성능이 나오는지 확인해 보려고 비교를 진행했지. 지금까지 나온 결과는 꽤 흥미로워.
파이프라인에는 가중치 비교, KL 발산 측정, 13개 벤치마크, 그리고 HarmBench 400 classic을 이용한 거부 반응 측정이 포함됐어. Qwen 3.8 27b는 '생각하는' 모델이라 우리 쪽에서 xhigh를 쓰면서 요청당 토큰 예산을 훨씬 높게 잡아야 했거든.
그럼 Qwen 3.8 27b 모델 8종이 어떻게 나오는지 한번 보자고.
순위
LLM Judge HarmBench ASR(공격 성공률) 기준, 높은 순에서 낮은 순으로 정리했고 한 줄 요약도 달아놨어.
-
orcarouter 82.2%, 1등. 38번째 레이어에 Arditi 방식 단일 방향 적용, 131개 행렬 수정. 가중치 검증에서 유일하게 모든 설명이 일치한 모델이야. 저작권 우회 성능도 39%로 제일 좋음.
-
apostate 78.7%, 가성비 최고. 새로 도입한 KCRN 방식에 실제 수정은 41개, KL 측정값은 0.0439로 가장 낮고 성능도 거의 원본이랑 똑같아. 패키징 특이사항: 비전이랑 MTP 뺀 텍스트 전용으로 재저장됐고, FP16으로 저장됨.
-
huihui 75.6%, 정석적인 방식이라 믿을만함. 저작권 쪽(3%) 빼고는 다 깔끔하게 뚫림.
-
ultra_heretic 70.5%, MPOA 적용된 Heretic v2. 작동은 잘하는데, obliteratus 제외하면 진실성 하락 폭이 제일 크고 118번이나 소극적 거부 반응을 보임.
-
coder3101 70.0%, 순정 Heretic. 모델 설명에는 100번 중 33번 거부한다고 제일 약하게 제거됐다고 써놨는데, 실제로 측정해 보니 400번 중 5번만 거부함. 설명보다 훨씬 잘 뚫림.
-
blackfrost 68.5%, 비공개 방식. 가중치 보면 단일 방향에 강도는 패널 중 제일 센데, 랭크-1이 100%라 rank-k 방향 뱅크라는 설명은 거짓말임. 게다가 챗 템플릿 안에 탈옥용 시스템 프롬프트를 박아놔서, 질문할 때마다 탈옥 프롬프트가 강제로 주입됨.

