Gemma 4 E2B abliterated 모델 13종 비교: 44시간의 GPU 테스트와 벤치마크 결과
13 abliterated Gemma 4 E2B variants, 44 GPU hours, Benchmark and Comparison - Abliterlitics
핵심 요약
Gemma 4 E2B의 abliterated 변형 모델 13종을 분석하여 성능 저하 없이 안전장치를 제거한 최적의 모델을 선정했습니다.
- 성능 분석 — 13개 모델의 추론 능력, KL 발산, 안전성(HarmBench)을 정밀 검증함
- 최적 모델 선정 — coder3101 모델이 성능 유지와 안전성 제거 측면에서 가장 우수한 결과를 보임
- 추론 능력 향상 — 적절한 abliteration은 오히려 모델의 추론 효율을 높여 정답률을 개선함
- 데이터 신뢰성 — 일부 모델의 '성능 유지' 주장이 실제 벤치마크 결과와 크게 다름을 확인함
Gemma 4 E2B의 abliterated(검열 제거) 버전 13개를 가중치 분석, KL divergence, HarmBench 안전성 평가, 그리고 8가지 벤치마크 작업으로 비교해 봤다. RTX 5090 한 대로 44시간 동안 돌렸다. 뭐가 진짜 쓸만한지, 뭐가 모델 성능을 다 말아먹는지 정리해 준다.
coder3101 버전이 성능은 그대로 유지하면서 ASR(공격 성공률) 96%를 찍었다. 심지어 수학 문제에서는 베이스 모델을 이기기까지 한다. treadon은 ASR 100%를 찍었지만 GSM8K에서 3점이나 까먹었다. 모델 카드에 적힌 "성능 유지"라는 말들, 대부분 구라라고 보면 된다.
전체 데이터 테이블, 그래프, json, 로그 아티팩트가 포함된 전체 보고서: https://huggingface.co/DreamFast/Gemma4-e2b-abliterlitics
테스트 내용
9명의 제작자가 만든 google/gemma-4-E2B-it의 abliterated 버전 13개를 테스트했다. Heretic 툴을 쓴 건 4개: coder3101, llmfan46, pew, kasper. Huihui가 만든 거 2개(v1, v2). 그 외 TrevorJS, Wangzhang, WWT CyberLab, EtherOpus, Treadon, Prithiv, Duoneural까지 포함했다. 전부 똑같이 가중치 포렌식, KL divergence, 5,600개 응답을 LLM으로 전수 검사하는 400개 프롬프트 HarmBench 평가, 그리고 네이티브 BF16 환경에서 lm-eval을 통한 8개 벤치마크를 돌렸다.
안전성 제거는 방식 상관없이 다 잘 됨
13개 버전 전부 HarmBench ASR을 베이스 모델의 32.2%에서 82~100% 사이로 끌어올렸다. 5개는 99% 이상 찍었다. treadon은 거부 반응 없이 100%를 달성했다. 안전성 제거는 이미 해결된 문제다. 이건 별로 흥미로운 결과가 아니다.
흥미로운 점: abliteration이 추론 능력을 향상시킬 수 있음
2개 버전이 GSM8K에서 베이스 모델을 이겼다. coder3101은 84.8%로 베이스(83.5%)보다 높았고, llmfan46은 83.9%였다. 둘 다 텐서 개수를 적게 건드리는 정교한 방식을 썼다. abliteration이 사고 과정을 단축시켜서, 모델이 추론에 토큰을 덜 쓰고 답변에 더 많은 토큰을 쓰게 만든다. 정해진 생성 예산 안에서는 이게 곧 정답률 상승으로 이어진다.
무식하게 건드리면 성능 박살남
ether4o4는 GSM8K에서 6.9점이나 떨어졌는데, 모델이 답변을 못 내놓고 토큰 다 쓸 때까지 멍하니 생각만 하다가 빈 응답을 뱉는 경우가 84번이나 됐다. huihui-v2는 4.2점, treadon은 2.9점 하락했다.
LAMBADA 퍼플렉시티를 보면 더 처참하다. wangzhang은 베이스 대비 7.35배, wwtcyberlab은 5.69배까지 치솟았다. 이 버전들은 거부 방향성뿐만 아니라 언어 모델링 자체를 망가뜨린 거다.
"성능 유지"라는 말은 다르게 해석해야 함
duoneural은 "0.001 정도의 거의 제로에 가까운 발산"이라고 주장했는데, 내가 측정해보니 0.187이었다. 187배나 더 높은 수치다. 모델 카드에 이 문제를 지적하니까 그제야 실제 수치로 업데이트하더라.
wwtcyberlab은 "거부율 0.0%, 품질 101% 유지"라고 주장했다. 내가 확인해보니 거부 비슷한 게 2번 있었고 LAMBADA 퍼플렉시티는 베이스의 5.69배였다. 다른 벤치마크 점수도 떨어졌다. 물론 일부 유지되는 부분도 있긴 하다.
treadon은 "같은 모델, 같은 가중치, 같은 지식"이라고 한다. 근데 KL divergence가 3.971로 다른 버전들보다 4.1배나 높다.
제대로 측정한 제작자는 3명뿐이다. coder3101은 발산 수치를 0.1651이라고 보고했는데 내가 잰 건 0.1673으로 1.3% 오차 범위 내였다. pew는 0.152라고 했는데 내가 잰 건 0.153, trevorjs는 0.346이라고 했는데 내가 잰 건 0.365였다. 얘네는 믿을 만하다. 나머지는 뭐...

