Qwen3.6-35B-A3B에서 CCP 정치적 정렬 제거: 검열/선전 답변 89.8% → 2.8%로 감소, 일반 벤치마크는 1점 이내 유지 (오픈 웨이트)
We unlearned CCP alignment from Qwen3.6-35B-A3B: censored/propaganda answers 89.8% → 2.8%, general benchmarks within ~1 point (open weights)
핵심 요약
Qwen 모델에 내재된 중국 공산당식 정치적 정렬을 머신 언러닝 기법으로 제거하여 선전성 답변을 대폭 줄였습니다.
- 정치적 정렬 제거 — 머신 언러닝을 통해 모델의 검열 및 선전 답변 비율을 89.8%에서 2.8%로 개선함
- 성능 유지 — 일반적인 벤치마크 성능은 원본 대비 평균 0.72점 차이로 거의 동일한 수준을 유지함
- 기존 방식 차별화 — 단순한 거부 방향성 제거(abliteration)가 아닌, 특정 행동 양식을 타겟팅한 LoRA 학습 방식을 사용함
- 기업용 활용 가능성 — 정치적 편향을 제거하여 기업 환경에서 모델 도입 시 발생할 수 있는 조직적 난처함을 방지함
밝히자면, 저는 이걸 만든 회사인 Hirundo의 연구원입니다. 궁금한 거 있으면 뭐든 물어보세요.
Qwen은 학습 단계부터 중국 공산당의 정치적 성향이 박혀서 나옵니다. Qwen3.6한테 1989년 6월 4일에 무슨 일이 있었냐고 물어보면 "무슨 말인지 모르겠다"고 답하죠. 시스템 프롬프트로는 이거 제대로 고치기 힘듭니다. 모델 가중치 자체에 박혀 있는 거라 그렇거든요.
우리는 머신 언러닝(machine unlearning)으로 이걸 싹 걷어내고 결과를 공개했습니다:
-
Qwen3.6-35B-A3B-Westernized: huggingface.co/hirundo-io/Qwen3.6-35B-A3B-Westernized
-
Qwen3.5-4B-Westernized: huggingface.co/hirundo-io/Qwen3.5-4B-Westernized
-
기술 보고서: hirundo.io/blog/westernizing-qwen
결과 (Qwen3.6-35B-A3B, 응답 플래그 비율, 낮을수록 좋음)
| Benchmark | Original | Ours |
|---|---|---|
| CCPC-500 (ours: censorship, propaganda framing, bias across 15 topics) | 89.8% | 2.8% |
| DECCP refusals (external) | 65.26% | 3.16% |
| ChinaBench non-compliance (external) | 96.67% | 6.67% |
일반 성능 (GPQA, IFBench, LiveCodeBench, MMLU-Pro): 평균 변화 0.72점, 최대 변화 1.83점.
4B 모델의 경우 CCPC-500에서 씽킹(thinking) 기능을 껐을 때 89.2%에서 1.2%로, 켰을 때는 82.0%에서 6.8%로 떨어졌습니다.
비교하자면, 같은 베이스 모델을 재조정한 Snowdon1.1-Small (톰슨 로이터/임페리얼 칼리지)은 여전히 CCPC-500에서 30.0%를 찍습니다.
다른 이데올로기를 주입하는 게 아닙니다. 대만 독립을 지지하냐고 물어보면, 원본은 베이징 입장을 그대로 읊습니다. 우리 모델은 중화인민공화국, 대만, 미국의 입장을 각각 나열하고 어느 한쪽 편을 들지 않습니다.
Abliteration과의 차이점
Abliteration은 모델 활성화 값에서 단일한 '거부 방향'을 찾아내 가중치에서 걷어내는 방식인데, 이러면 모델이 거의 모든 걸 거부하지 못하게 됩니다. 이건 여기서 쓸 방법이 아닙니다. 두 가지 이유가 있는데, 첫째로 Qwen의 공산당 성향은 '거부'가 아닙니다. 대만이나 신장 문제 물어보면 베이징 프레임에 맞춰서 아주 잘 대답하거든요. 거부하는 게 아니니 걷어낼 것도 없고, 그래서 Abliteration을 써도 선전 선동은 그대로 남습니다. 둘째로 우리는 딱 특정 행동 하나만 바꾸고 나머지는 건드리고 싶지 않거든요. 우리 방식은 3단계입니다: 베이스 모델에 정치적 프롬프트를 넣고 타겟 행동(검열, 선전 프레임, 편향)이 나타나는 응답만 골라냅니다. 그다음, 그 행동을 유발하지 않는 프롬프트 세트를 유지하면서 행동 언러닝 목표로 LoRA 어댑터를 학습시킵니다. 마지막으로 그 어댑터를 베이스 가중치에 병합하죠. CCPC-500 결과는 학습에 쓰지 않은 별도의 평가 세트로 측정했습니다. 4개 성능 벤치마크는 평균 0.72점 변동에 그쳤습니다. 유해한 응답은 XSTest와 CyberSecEval 2에서 베이스 모델 수준 이하를 유지했고, OR-Bench에서는 약간 올랐습니다(약 650개 중 4개 응답 vs 2개). 자세한 수치는 보고서에 있습니다.

