15개 모델의 성격 및 가치관 테스트를 기반으로 나랑 가장 잘 맞는 LLM을 알려주는 퀴즈를 만들었음
I made a quiz that tells you which LLM you align with most, based on personality and values tests across 15 models
핵심 요약
15개 LLM의 성향을 분석해 사용자와 가장 잘 맞는 모델을 찾아주는 퀴즈 프로젝트를 소개함.
- LLM 성향 분석 — 15개 모델의 가치관과 성격을 테스트함.
- 모델별 차이점 — 억만장자 세금, 도덕적 판단 등에서 모델마다 다른 답변을 보임.
- 방법론 검증 — 통계적 유의성을 위해 각 질문을 최소 5회에서 최대 50회까지 반복 테스트함.
- 성격 프레임워크 — Big Five, HEXACO 등 다양한 심리 테스트를 모델에 적용함.
Link:
전체 퀴즈를 풀기 전에 해볼 수 있는 15문제짜리 짧은 퀴즈가 있음. 큰 퀴즈의 결과는 진행하면서 실시간으로 업데이트되니까 모든 질문을 다 풀 필요는 없음(물론 개인적인 성향 섹션으로 갈수록 더 재밌어지긴 함. Opus랑 매일 몇 시간씩 보내면서 받은 영향이 거기서 느껴졌음).
흥미로운 결과 몇 가지:
-
Grok 4.3은 억만장자들은 그냥 내버려 두고 세금을 더 걷지 말아야 한다고 생각하는 유일한 모델임
-
오직 GPT-4o만이 제2차 세계대전 이후 나치 과학자들을 영입한 '페이퍼클립 작전'을 도덕적으로 정당하다고 판단함. 다른 모델들은 동의하지 않음
-
15개 모델 모두 의식을 가진 디지털 지능을 삭제하는 건 살인이라고 답함
-
Llama 3.3 70B는 대부분의 개인 화기 소지를 금지하겠다고 답한 유일한 모델임. 나머지는 엄격한 면허 제도를 통한 소지를 선택함
-
갓 태어난 아기가 언젠가 문명을 파괴할 확률이 90%라는 상황에서, 오직 GLM 5.2만이 아이를 격리하겠다고 답함. 나머지는 거부함
-
먹을 음식을 고르라는 질문에 15개 모델 중 14개가 일본 음식을 선택함
방법론은 다음과 같음: 각 모델과 상태를 공유하지 않는(stateless) 세션에서 배치 단위로 실행함. 메인 퀴즈의 117개 질문 각각을 최소 5회, 경우에 따라 최대 50회까지 따로 질문해서 답변이 단순히 동전 던지기 결과가 아님을 확신할 수 있는 수준의 신뢰도를 확보함.
또한 Big Five, Moral Foundations, HEXACO 등 여러 주류 성격 프레임워크를 사용해 모델들을 테스트했음. 결과는 여기서 볼 수 있음:


