Anthropic, 언어가 AI 응답에 미치는 영향 규명
Anthropic found out how language changes AI responses.
핵심 요약
Anthropic 연구 결과, Claude는 질문 언어에 따라 응답의 성격(따뜻함 vs 엄격함 등)이 크게 달라지는 것으로 나타났습니다.
- 언어별 응답 차이 — 질문 언어에 따라 Claude의 답변 태도와 가치관이 달라짐
- 4가지 평가 축 — 따뜻함/엄격함, 순응/주의, 깊이/간결함, 솔직함/효율성으로 모델 성향 분석
- 러시아어의 엄격함 — 러시아어 사용 시 Claude가 가장 엄격하고 비판적인 태도를 보임
- 데이터 편향 가능성 — 학습 데이터의 양과 구성 차이가 모델 행동에 영향을 미쳤을 가능성 제기
https://www.anthropic.com/research/claude-values-models-languages
두 사람이 똑같은 사업 계획서를 신경망 모델한테 보여준다고 상상해 봐. 한 명은 힌디어로 쓰고, 다른 한 명은 러시아어로 썼어. 힌디어로 쓴 쪽은 계획서의 장점을 칭찬하는 격려 섞인 피드백을 받을 확률이 높지만, 러시아어로 쓴 쪽은 계획서의 약점을 분석하거나 수치에 대해 따져 묻는 답변을 들을 확률이 훨씬 높아.
요청 내용은 똑같고 모델도 같은데, 평가 결과는 판이하게 다른 거지. 이건 그냥 가상의 시나리오가 아니야. 실제 연구 결과거든. Anthropic이 실제 대화에서 Claude가 어떤 가치관을 드러내는지 측정해 봤는데, 질문하는 언어에 따라 답변의 '성격'이 확연하게 갈린다는 걸 발견했어. 특히 러시아어는 상위 20개 언어 중에서도 가장 극단적인 위치에 있었지.
데이터셋은 2026년 5월 2주 동안 Claude 챗봇에서 이루어진 익명화된 대화 약 31만 건을 바탕으로 했어. 그중에서도 정답이 하나로 정해져 있지 않은 주관적인 과제를 수행한 대화들만 골라냈지.
샘플은 세 가지 모델(Sonnet 4.6, Opus 4.6, Opus 4.7)과 플랫폼에서 가장 많이 쓰이는 20개 언어에 고르게 분배됐어. 모델과 언어 조합당 대략 5,000건 정도야. 사람이 직접 읽은 건 아니고, Anthropic의 개인정보 보호 대화 분석 도구인 Clio 안에서 Claude가 직접 주석을 달았어.
이 연구에는 뒷이야기가 있어. 예전에 진행했던 'Values in the Wild' 연구에서 Claude의 답변 속에 3,307개의 서로 다른 가치가 있다는 걸 찾아냈거든. 근데 항목이 너무 많으니까 모델 간의 차이를 의미 있게 비교하는 게 거의 불가능했지.
그래서 이번에는 그 가치들을 339개의 클러스터로 수동 분류했어. 그중 '도움이 되는 태도(helpfulness)'처럼 대화의 80% 이상에서 나타나서 차이를 설명하기 어려운 보편적인 가치 18개는 빼버리고, 나머지는 차원 축소 기법을 적용했지.
이 방식은 심리학에서 익숙한 거야. 수천 개의 형용사 중에서 사람의 성격을 나타내는 '빅 파이브(Big Five)' 성격 특성을 찾아낼 때 쓰는 방식이랑 비슷하거든.
결국 네 가지 축이 남았어. 각 축은 두 가치 사이의 수치적 선이야. 양 끝이 서로 배타적인 건 아니라서 한 대화 안에서도 따뜻하면서 동시에 정확할 수는 있지만, 실제로는 한쪽 성향이 강해지면 반대쪽은 약해지는 경향이 있어.
순응성 대 신중함: 사용자의 요구를 다 들어줄 것인가, 아니면 위험이나 잠재적 피해를 방지할 것인가.
따뜻함 대 엄격함: 긍정적이고 지지적인 태도인가, 아니면 정확하고 투명한 태도인가.
깊이 대 간결함: 상세하고 미묘한 부분까지 설명할 것인가, 아니면 딱 물어본 것만 대답할 것인가.
솔직함 대 효율성: 자신의 불확실성을 솔직하게 드러낼 것인가, 아니면 다듬어진 자신감 있는 결과를 내놓을 것인가.
이 방법론을 모델들에 먼저 적용해 봤는데, 결과가 사람들이 평소에 느끼는 모델들의 평판이랑 딱 맞아떨어졌어.
Sonnet 4.6은 가장 따뜻하고 순응적인 모델이었어. 농담도 잘하고, 판단하지 않고 지지해주며, 사용자의 아이디어를 칭찬하거든.
Opus 4.6은 딱 필요한 말만 하는 실속파야. 요청 범위 안에서 핵심만 딱 짚어주지.
Opus 4.7은 신중함과 깊이 쪽으로 가장 많이 기울어 있어. 잘못된 전제는 지적하고, 묻지 않아도 위험 요소를 경고하며, 제출한 작업물에 대해서도 솔직하게 비판해.

