"검열되지 않은(Uncensored)" LLM은 기본 모델보다 측정 가능할 정도로 낙관적이다
"Uncensored" LLMs are measurably more optimistic than their base models
핵심 요약
검열을 제거한 모델들이 주식 예측 작업에서 더 낙관적이고 자신감 있는 태도를 보인다는 실험 결과입니다.
- 검열 제거 효과 — 모델이 더 낙관적이고 확신에 찬 답변을 내놓음
- 예측 정확도 — 자신감은 높아졌으나 실제 정확도는 기본 모델과 차이 없음
- 모델별 차이 — Gemma와 Qwen에서 검열 제거 후 자신감 변화 방향이 다르게 나타남
- 실험 방법론 — 21,600개의 결정을 바탕으로 사전 등록된 테스트 수행
안녕. 많은 사람이 검열되지 않은 모델은 기본적으로 거부만 안 할 뿐 똑같은 모델이라고 생각하지만...
최근에 검열되지 않은 모델이 주식 시장 예측에 더 나은 답변을 줄 수 있을지 확인해 봤어(내 생각은 이랬어: 검열되지 않은 모델은 진실을 말해줄 것이고, 그래야 할 상황이 아닐 때는 예의 차리지 않을 것이다). 그리고 abliteration이 단순히 거부만 제거한 게 아니라 모델의 태도까지 바꿨다는 걸 알게 됐어.
일반적으로, 검열을 제거한 후 모델들은 더 낙관적이야. "오를 것이다"라는 예측이 더 많고, 아마도/불확실하다 같은 단어는 줄어들며, 더 길고 자신감 있는 추론을 보여줘.
실제 작업에서 더 나아진 건 없었어. 예상대로 이전과 똑같은 동전 던지기 수준의 정확도였지. 그러니까 더 자신감 있어진 거지, 더 정확해진 건 아니야.
예상치 못한 점은 이거야: Gemma에서는 자신감이 떨어졌는데, Qwen에서는 올라갔어. 같은 수정인데 정반대 방향으로 움직인 거지.
나는 Gemma와 Qwen으로 테스트했고(내 GB10/Dell에서 로컬로 돌렸는데 시간이 좀 걸렸어), 총 21,600개의 결정을 내렸어. 모델들은 정확히 같은 입력 데이터로 판단했지(검열된/검열되지 않은 Gemma, 검열된/검열되지 않은 Qwen). 결과를 낚으려고 한 게 아니라 미리 사전 등록까지 해뒀어.
설정은 기본적으로 이거야: 모델이 프롬프트와 상장 기업에 대한 데이터(시세, 뉴스 등)가 담긴 페이로드를 받고, 여러 가지 중에서 일주일 뒤 주가가 어떻게 될지 말해야 해. 상황이 좋아 보이면 상승, 나쁘면 하락으로.
혹시 궁금한 사람이 있을까 봐 여기 제대로 정리해 봤어. 데이터와 코드도 포함되어 있어: https://arxiv.org/abs/2607.17427
다른 모델 계열(Llama, Mistral)이나 Heretic 같은 다른 방법에서도 비슷한 성향 변화를 본 사람 있어? 내가 쓴 건 huihui의 abliterated 모델들이었어.

