가장 싼 AI를 사지 마세요: 모호한 질문 하나로 여러 모델을 테스트해 본 결과
Don't Buy the Cheapest AI: I Tested Several Models With One Vague Question
핵심 요약
AI 도구 선택 시 가격보다 사용자의 모호한 질문을 얼마나 잘 이해하고 즉각적인 해결책을 제시하는지가 더 중요합니다.
- 평가 기준 변화 — 월간 구독료보다 실제 작업 효율성을 우선시함
- 실제 테스트 사례 — 모호한 질문과 이미지를 통해 모델의 추론 능력 확인
- 비용의 재정의 — 문제 해결에 드는 시간과 노력까지 포함한 실질적 비용 고려
- 작업별 모델 선택 — 고위험 작업에는 고성능 모델을, 단순 작업에는 저비용 모델을 활용
요즘 AI 툴을 평가하는 기준을 바꿨다. 월 구독료가 얼마인지는 이제 별로 안 중요함. 딱 하나만 보면 됨.
사용자가 완벽한 프롬프트를 짤 줄 몰라도, 이 툴이 진짜 업무를 진전시킬 수 있는가?
이 차이를 확실하게 보여준, 아주 간단하고 비과학적인 테스트 하나를 소개함.
친구가 맥북에서 윈도우를 돌리다가 뭘 잘못 건드렸는지 사진 한 장이랑 딱 이 문장 하나를 보냄.
“내 바탕화면이 이렇게 됐는데, 이거 어떻게 원래대로 돌려?”
보통 사람들은 다 이렇게 물어봄. OS 버전이 뭔지, 프롬프트를 어떻게 구조화해야 하는지, 증상을 어떻게 설명해야 하는지 따위는 모름.
그래서 유명한 멀티모달 모델 몇 개에 똑같은 사진이랑 문장을 던져봤음. 이건 벤치마크도 아니고, 모델 성능을 영구적으로 평가하는 것도 아님. 내가 확인하고 싶었던 건 훨씬 좁은 범위였음. 모델이 상황을 제대로 파악해서, 바로 확인 가능한 해결책을 짧게 제시할 수 있느냐는 거였지.
쓸만한 답변들은 이게 윈도우 10의 '전체 화면 시작 메뉴'라는 걸 바로 알아채고 구체적인 경로를 알려줌: 개인 설정 → 시작 → “전체 화면에서 시작 메뉴 사용” 끄기.
반면에 어떤 답변들은 태블릿 모드, 가상 머신 설정, 디스플레이 문제 같은 가능성만 나열하면서 사용자보고 하나하나 다 확인해보라고 함. 틀린 말은 아닌데, 결국 귀찮은 일을 다시 사용자한테 떠넘기는 꼴임.
그래서 난 이제 '저렴한 가격'이 올바른 지표라고 생각 안 함. 진짜 비용은 이런 것들을 포함해야 함:
-
문제를 설명하는 데 들어가는 노력.
-
첫 답변이 맥락을 제대로 파악했는지 여부.
-
추가 질문이나 수정이 몇 번이나 필요한지.
-
최종 답변을 검증하는 데 걸리는 시간.
중요한 업무라면 비싼 모델이 오히려 더 쌀 수도 있음. 쓸데없는 대화 몇 번 줄여주고 바로 확인 가능한 해결책을 주니까. 반대로 포맷팅, 초안 작성, 요약, 데이터 추출, 단순 반복 작업 같은 저위험 업무에는 저렴한 모델도 충분히 훌륭함.
지금 내 원칙은 간단함: 모델을 고정된 순위표로 보지 말고, 작업에 맞춰서 골라 쓰라는 거임. 그리고 특히 설정, 건강, 돈, 법률, 중요한 결정 같은 문제에서 AI가 자신 있게 내놓는 답변은 무조건 맹신하지 말고, 검증해야 할 '가설' 정도로만 생각하셈.
너희는 최근에 AI 답변 덕분에 시간을 아꼈냐, 아니면 오히려 일만 더 늘어났냐?


