Claude Code가 GPT-5.6, DeepSeek, GLM, 로컬 Qwen에 작업을 위임하도록 MCP 서버를 구축하고 벤치마크해 보았습니다 (198회 실행, 비공개 테스트)
I built an MCP server so Claude Code can delegate work to GPT-5.6, DeepSeek, GLM and a local Qwen — then benchmarked all of them against Claude itself (198 runs, hidden tests)
핵심 요약
Claude Code가 여러 모델에 작업을 위임할 수 있는 MCP 서버를 구축하고, 모델별 성능과 비용을 벤치마크한 결과입니다.
- MCP 서버 구축 — Claude Code가 외부 모델(GPT, DeepSeek 등)에 작업을 직접 위임하도록 구현함
- 벤치마크 수행 — 6개 작업 스테이션에서 11개 모델을 3회씩 반복 테스트하여 성능과 일관성을 검증함
- 비용 효율성 확인 — Codex 계열 모델이 저렴한 비용으로 높은 정확도를 보여주며 실무에 매우 유용함
- 로컬 모델의 한계 — 로컬 Qwen은 성능은 준수하나 예측 불가능한 오류가 발생해 자동 검증이 필수적임
똑같은 원리가 MCP를 지원하는 모든 에이전트에 적용돼. 핵심은 메인 앱을 나갈 필요 없이 다른 회사 모델들한테 작업을 떠넘길 수 있다는 거지.
시작하기 전에: 이건 순전히 내 개인적인 테스트용으로 만든 거고, 내 환경을 어떻게 세팅할지 결정하려고 한 거야. 그냥 혹시나 도움 될까 싶어서 공유하는 거니까 참고해. 그리고 맞음, 이 글 AI 써서 썼어. 내가 직접 쓸 시간이 어디 있냐. 만약 글 내용엔 관심 없고 AI가 썼다고 불평하러 온 거면 그냥 뒤로가기 눌러라.
세 줄 요약: 내가 쓰는 메인 앱인 Claude Code가 다른 모델들(Codex CLI, DeepSeek, z.ai, LAN으로 연결된 로컬 LM Studio)한테 작업을 위임할 수 있게 작은 MCP 서버를 하나 짰어. 앱을 나갈 필요가 전혀 없지. MCP를 지원하는 에이전트 시스템이라면 어디든 똑같이 적용돼. 그 다음엔 Claude를 시켜서 모든 경로를 벤치마크 돌려봤어. 6개 스테이션 × 11개 모델 × 3라운드, 모델들이 문제 보기 전에 미리 작성해둔 비공개 테스트 스위트로 채점했지. 단 한 번만 돌린 결과는 양쪽 다 구라였어. 1라운드에서 발견한 '저가형 모델의 실수'는 사실 그 모델의 '평소 실력'이었고(운 좋게 잘 나온 게 예외였던 거임), Anthropic 베이스라인 두 개는 3번 중 2번이나 같은 스테이션에서 털렸어. 반면에 GPT-5.6 Codex 계열 전체(100만 토큰당 1달러짜리 Luna 포함!)는 54번의 실행 전부 다 100% 성공했지.
세팅
난 바이브코딩으로 이것저것 만드는 비개발자고, Claude Code (Fable 5)를 주력으로 써. 내가 만든 MCP 서버("multimodels")는 list_models랑 delegate_task라는 두 가지 도구를 제공하고, 아래 모델들로 라우팅해줘.
- GPT-5.6 Sol, Terra, Luna: Codex CLI 경유 (ChatGPT 구독; xhigh 추론)
- DS4 Flash / DS4 Pro: (DeepSeek v4)
- GLM 5.2: z.ai 코딩 플랜 구독 경유 (팁: 구독 키는
/coding/엔드포인트에서만 작동함. 일반 엔드포인트 쓰면 "잔액 부족"이라는 낚시성 에러 뜸) - Qwen3.6 35B A3B: LAN으로 연결된 다른 컴퓨터의 LM Studio에서 로컬 구동
베이스라인: Claude Fable 5, Opus 4.8, Sonnet 5, Haiku 4.5 (기본 설정으로 Claude Code 서브 에이전트 역할)

