2개월간의 (밈스러운) 연구: 사람들이 AI 모델 간의 차이를 알아챌까?
2 months (meme-d) research, Do People Notice the Difference Between AI Models?
핵심 요약
일반인 13명을 대상으로 다양한 AI 모델을 테스트한 결과, 사람들은 모델의 성능보다 답변의 가독성과 형식을 더 중요하게 여겼습니다.
- 실험 설계 — 일반인 13명을 대상으로 7,912건의 요청을 처리하며 모델별 반응 차이 관찰
- 사용자 선호도 — 복잡한 추론 모델보다 가독성이 좋고 답변 형식이 깔끔한 Gemma 모델을 압도적으로 선호함
- 추론의 역설 — 모델이 '생각하는 과정'을 보여주면 답변의 질과 상관없이 더 똑똑하다고 인식함
- 실제 사용 패턴 — 대부분의 사용자는 깊은 추론보다는 구글 검색 대용으로 즉각적인 답변을 원함
서문 및 면책 조항, 표본 크기: 8명. 어떤 규모로 보든 이 연구는 그냥 심심해서 끄적여본 거임.
이건 일반인들이 하이엔드 AI 모델을 진짜로 구분할 수 있는지 궁금해서 해본 소소한(사실은 꽤 큰) 호기심 테스트였음. 우리나라는 AI에 대해 대체로 중립적인 편임. AI를 딱히 혐오하지도 않고 그렇다고 AI에 미쳐서 빨아대지도 않음. 다만, 상품 상세 페이지에 게재된 성의 없고 퀄리티 낮은 AI 생성 이미지에 대해서는 (당연하게도) 꽤 부정적인 반응이 있음. 실험 끝나고 참가자들한테 결과 공개해도 되냐고 물어보고 허락받았다.
------ 아무튼 ------
실험 초기에는 로컬 모델이랑 OpenRouter를 같이 썼음. 근데 2주 지나고 나서 OpenRouter는 그냥 빼버림. 놀랍게도 내 RTX 3090이 거의 일을 안 하더라고. 사용량이 시간당 5~6건 정도로 찔끔찔끔 들어오는 수준이었거든. 램 96GB를 Warm KV 스토어로 쓰고 나머지는 SSD에 박아놨는데도 이 정도였음.
참가자 13명한테는 대충 이렇게 말했음: "최신 챗GPT 모델을 공짜로 쓸 수 있게 됐는데, 기간이 좀 짧아. 이제 '메모리 부족' 같은 헛소리 안 봐도 되는데, 내가 OpenAI랑 연동해놔서 내 웹사이트를 통해서만 써야 해. 그리고 이상한 거 묻지 마라. 나도 보기 싫은데 기술적으로는 데이터베이스에서 니들 활동 로그 다 볼 수 있으니까." IP 트래픽 패턴 보니까 8명 정도는 진짜로 믿은 것 같음.
웹 UI는 Qwen 3.6 27B로 수정한 OpenWebUI 인스턴스였고, 관리자 패널은 다 숨겨놨음.
실험 내용은 간단했음. Qwen 3.6 27B, Qwen 3.6 35B-A3B, Gemma 26B-A4B, Qwen 3.5 9B, Gemma 12B, Gemma E4B, Gemma E2B를 번갈아 가면서 돌렸음. 추론 강도는 즉시(instant), 낮음(low), 중간(medium), 높음(high) 4단계로 나눴고, 35B 모델 빼고는 전부 VLLM으로 돌림.
목표는 사람들이 모델이 뭔지도 모르는 상태에서 모델 간의 유의미한 차이를 느끼는지, 품질에 대해 불평하는지, 아니면 특정 모델을 선호하게 되는지 확인하는 거였음.
9B 이하 모델부터 불만이 나오기 시작함. 가장 흔한 불만은 모델이 "말귀를 못 알아먹는다"는 거였음. 예상대로 다들 Gemma 모델 답변을 더 좋아하더라. 다른 모델들에 대해서는 참가자 3명이 "가끔 모델이 생각을 너무 많이 해서 혼란스러운 로봇처럼 들린다"고 하더라고. 다들 무슨 모델 말하는지 알겠지?
마지막 사진은 Q3.6 27B OpenWebui 리스타일
총 7,912건의 요청 중에서 '높음' 추론을 쓴 건 51건밖에 안 됨. '즉시'가 4,588건, '중간'이 2,263건이었고 나머지는 '낮음'이었음. 그러니까 결론은, 대다수 사용자는 '높음' 추론 모드를 쓸 생각도 안 했다는 거임. 내가 분명히 최고 성능 모드로 설정하는 토글 있다고 말해줬는데도 말이야.
재밌는 건, 몇몇 참가자들은 추론 과정을 볼 수 있다는 이유만으로 모델을 최고급이라고 평가했다는 거임. 대충 이런 식의 코멘트가 있었음:



