GPT 5.6, GLM 5.2, DeepSeek V4 Pro, Gemini 3.1 Pro, Opus 5 일주일간 벤치마크 후 솔직한 비교
my honest comparison of gpt 5.6 vs glm 5.2 vs deepseek v4 pro vs gemini 3.1 pro vs opus 5 after benchmarking them all week
핵심 요약
작성자가 직접 데이터셋과 실무 작업을 통해 최신 AI 모델들의 성능, 비용, 활용도를 비교 분석했습니다.
- 모델별 강점 — 코딩은 Opus 5와 GPT 5.6, 논리 추론은 Gemini 3.1 Pro가 우세함
- 비용 효율성 — DeepSeek V4 Pro와 GLM 5.2가 가성비 면에서 압도적임
- 실무 활용 전략 — 작업 성격에 따라 모델을 조합하는 하이브리드 방식이 가장 효과적임
- 벤치마크 한계 — 공개된 수치보다 실제 업무 환경에서의 체감 성능이 중요함
다들 안녕. 이번 주 내내 다들 뭐가 제일 좋네 마네 싸우길래, 내가 직접 내 데이터셋이랑 실무 작업 돌려보면서 벤치마크 싹 다 해봤거든. 실제 수치랑 체감 성능 바탕으로 솔직하게 리뷰 남긴다. 여기 계정 만든 지 얼마 안 됐는데, 인터넷에 올라오는 리뷰들이 죄다 광고 같아서 답답한 마음에 공유해 봄.
일단 깡지능이랑 코딩 능력부터 보자. gpt 5.6 sol이 현재 artificial analysis 스냅샷에서 57.2점으로 1등 먹었고, opus 5가 56.5점으로 바로 뒤를 쫓는 중임. 에이전트 코딩 작업에서는 opus 5가 진짜 괴물이라 에이전트 인덱스 55.3%로 1위 찍더라. 근데 오픈 웨이트 모델인 glm 5.2가 가성비가 미쳤음. swe bench pro에서 62.1%, terminal bench 2.1에서 81% 나오거든. deepseek v4 pro는 수치 엄청나게 홍보하던데, terminal bench 2.1에서 직접 테스트해보니까 54.68%밖에 안 나와서 광고한 거에 비하면 좀 실망스러웠음.
추론이랑 복잡한 로직 패턴은 gemini 3.1 pro가 지금 킹임. 구글 딥마인드가 이번에 제대로 일 냈는데, arc agi 2에서 77.1% 찍었거든. 이전 버전보다 성능이 두 배 넘게 뛴 거임. omniscience index에서도 30점(positive 30)으로 압살 중인데, opus는 11점(positive 11)밖에 안 됨. gemini는 100만 토큰 컨텍스트 윈도우라 덩치 큰 파일도 그냥 가볍게 처리함.
이제 비용 얘기 좀 해보자. 여기가 진짜 재밌는 부분임. deepseek v4 pro는 입력 토큰 100만 개당 0.435달러, 출력 토큰 100만 개당 0.87달러로 미친 듯이 쌈. opus 5가 입력 5달러, 출력 25달러인 거 생각하면 비교도 안 됨. glm 5.2도 추론 작업 아닌 거 돌릴 땐 100만 토큰당 0.90달러라 가성비 개쩜. gpt 5.6은 luna라고 싼 티어가 있긴 한데, sol의 풀파워를 쓰고 싶으면 돈 좀 깨져야 함.
결론은 딱 하나가 최고는 아니라는 거임. 에이전트 성능이랑 코딩이 중요하다? 그럼 opus 5나 gpt 5.6 sol 쓰면 됨. 깊은 추론이나 긴 컨텍스트 윈도우가 필요하다? 그럼 gemini 3.1 pro가 압도적임. 예산이 빡빡하거나 오픈 소스 선호한다? 그럼 deepseek v4 pro나 glm 5.2가 가성비 미친 수준임. 너네 생각은 어떠냐?


