Qwen-Scope: Qwen 3.5 모델을 위한 공식 희소 오토인코더(SAE) 공개
Qwen-Scope: Official Sparse Autoencoders (SAEs) for Qwen 3.5 models
핵심 요약
Qwen 팀이 모델 내부 개념을 시각화하고 제어할 수 있는 희소 오토인코더 도구인 Qwen-Scope를 공개했습니다.
- 내부 개념 시각화 — 모델의 은닉 상태를 분석하여 특정 개념이나 특징을 식별함.
- 기능 제어(Steering) — 특정 특징을 강제로 활성화하거나 억제하여 모델의 출력 스타일을 조정함.
- 모델 디버깅 — 모델이 왜곡된 반응을 보이거나 언어가 섞이는 원인을 추적함.
- 학습 데이터 분석 — 파인튜닝 데이터가 모델 내부의 어떤 특징을 활성화하는지 검증함.
Qwen 팀이 Qwen 3.5 제품군(2B에서 35B MoE까지)을 위한 희소 오토인코더(SAE) 모음인 Qwen-Scope를 공개했습니다. 모든 레이어에 걸쳐 잔차 스트림(residual stream)의 내부 특징을 매핑했습니다.
이게 정확히 뭔가요? 모델 내부 개념의 사전이라고 생각하면 됩니다. 원시 숫자를 보는 대신 '법률적 대화', '파이썬 코드', '거부'와 같은 개념을 나타내는 특정 '특징(features)'을 볼 수 있습니다.
이걸로 뭘 할 수 있나요?
- 외과적 제거(Surgical Abliteration): 거부나 도덕적 설교를 담당하는 정확한 특징 ID를 찾아 억제할 수 있습니다. 이는 표준적인 '평균 차이' 방식보다 훨씬 정밀하며 추론 능력을 보존하는 데 도움이 됩니다. 참고: Qwen 팀은 라이선스에서 안전 필터를 제거하거나 '모델 기능에 간섭'하는 용도로 이 도구를 사용하는 것을 명시적으로 권장하지 않지만, 기술적으로는 이 SAE들이 정확히 그런 기능을 가능하게 합니다.
- 특징 제어(Feature Steering): 은닉 상태에 특징 방향을 주입하여 생성 중에 특정 개념을 '강제 활성화'할 수 있습니다(예: 모델을 더 기술적으로 만들거나 특정 스타일을 강제함).
- 모델 디버깅: 특정 토큰이 어떤 내부 방향을 유발하는지 식별할 수 있습니다(예: 예상치 못한 언어 전환이나 거부 반응).
- 데이터셋 분석: 파인튜닝 데이터가 의도한 내부 특징을 실제로 활성화하는지 스캔할 수 있습니다.
실제 작동 방식(Space 데모 예시):
- 진단: 모델이 이상하게 행동할 때(예: 영어로 질문했는데 갑자기 중국어를 섞어서 대답함) 특징 비교(Feature Comparison) 탭을 사용할 수 있습니다. 어떤 특징 ID가 급증했는지 정확히 보여줍니다. 예를 들어 '특징 #6159'(중국어)가 과도하게 활성화되었다는 히트맵을 볼 수 있습니다.
- 제어(Steering): ID를 알게 되면 특징 제어(Feature Steering) 탭을 사용하여 특정 특징을 '음소거'하거나 다른 특징(예: '고전 문학 스타일')을 '증폭'할 수 있습니다. 프롬프트로 모델과 싸우는 대신, 말 그대로 모델의 뇌에 있는 다이얼을 돌리는 것입니다.
Space: https://huggingface.co/spaces/Qwen/Qwen-Scope
논문: https://qianwen-res.oss-accelerate.aliyuncs.com/qwen-scope/Qwen_Scope.pdf


