M5 Max 128GB, 17개 모델, 23개 프롬프트 테스트: Qwen 3.5 122B는 여전히 로컬의 왕이다
M5 Max 128GB, 17 models, 23 prompts: Qwen 3.5 122B is still a local king
핵심 요약
M5 Max 128GB 환경에서 다양한 로컬 LLM을 테스트한 결과, Qwen 3.5 122B가 속도와 성능 면에서 여전히 최강임을 확인했다.
- 로컬 LLM 활용 — 개인 데이터 프라이버시 보호를 위해 학교 관련 데이터를 로컬에서 처리함
- 벤치마크 테스트 — 17개 모델과 23개 프롬프트를 사용하여 실제 사용 환경에서 성능을 비교함
- 하드웨어 성능 — M5 Max 128GB 환경에서 Qwen 3.5 122B가 압도적인 토큰 처리 속도를 보여줌
- Gemma 4 평가 — 31B 모델이 122B 모델과 경쟁할 정도로 뛰어나지만 속도 면에서 아쉬움이 있음
마지막 Llama(Scout/Maverick)가 출시된 지 1년이 지났습니다. 그 이후로 미국 기반의 모델 출시는 매우 드물었습니다: Granite 3.3, GPT-OSS 20B & 120B, Nemotron 3 Nano / Super, 그리고 이제 Gemma 4까지 나왔죠. 중국의 견고한 오픈 모델들이나 Qwen, DeepSeek, Kimi, MiniMax, GLM, MiMo, Seed 등과는 비교조차 할 수 없습니다.
Gemma 4는 신선한 공기 같은 존재입니다. 모델 자체뿐만 아니라 출시 방식, 아름다운 시각화, 그리고 혁신적인 기술들(글로벌 어텐션의 K=V, 레이어별 임베딩, 3모달 미니 모델인 E4B, E2B 등)까지 말이죠.
제 로컬 LLM 사용은 대부분 클라우드 GPU(Google Cloud, AWS 등)를 빌려 쓰는 방식이었습니다. 하지만 한 달 전쯤 모든 것을 집으로 가져오기로 결심하고, 멋진 M5 Max MacBook Pro 128GB를 구매했습니다. 이 노트북은 괴물 같은 성능을 자랑하며, 128GB의 통합 RAM 덕분에 로컬에서 실행할 수 있는 모델의 폭이 완전히 넓어졌습니다.
비용 외에도 로컬에서 모델을 실행하는 진정한 이점은 프라이버시입니다. 저는 제 데이터를 'OpenRouter => 모델 A'로 보내거나 AWS의 P4d/P4de 인스턴스(NVIDIA A100)에 호스팅하는 것이 결코 편하지 않았습니다. 여전히 제 데이터이고, 제가 있는 '집'이 아니니까요.
하지만 제 노트북은 제 집에 있습니다.
LLM의 경우, 연구나 코딩이 아니라면 유틸리티를 찾기가 어렵습니다. 하지만 저에게는 학교에 다니는 아이들이 있고, 아이들의 데이터가 흩어져 있는 다양한 시스템, 통신 불일치 등 미국 공립 학교의 조직 체계는 매우 엉망입니다. 하지만 부모가 된다는 것은 즐거운 일이고, 이런 혼란은 LLM이 정리하기에 아주 좋은 대상입니다. 로컬 LLM은 마지막 조각을 해결해 줍니다. 아이들의 데이터가 집 안의 제 노트북에 머무르게 하는 것이죠.
그래서 시작했습니다. 128GB의 괴물 같은 노트북에 가능한 모든 것을 로드하고 어떤 모델이 무엇에 좋은지 살펴보기 시작했습니다. 과정은 어렵지 않습니다. 학교 관련 웹사이트들을 돌아다니는데, 어떤 곳은 API가 있고, 어떤 곳은 Playwright로 스크린 스크래핑을 해야 하며, 어떤 곳은 캡차와 로그인이 섞여 있습니다. 웹사이트에 접속하면 어떤 선생님은 슬라이드 13에 정보를 올려두고, 어떤 정보는 모호한 폴더에, 또 어떤 정보는 여러 링크 아래 숨겨져 있습니다. LLM은 이 모든 모호함을 탐색하고 내일, 혹은 이번 주에 무엇이 마감인지, 성적은 어떤지, 왜 그런 성적이 나왔는지 등을 명확하게 알려줘야 합니다. 다시 말하지만, 명확한 목표를 가진 방대한 비정형 텍스트를 최적화하는 것은 LLM의 아주 좋은 활용 사례입니다.
아마 지금쯤 'OpenClaw'를 생각하고 계실 겁니다. 맞습니다. 저도 거기서 시작했지만, OpenClaw도 결국 그 뒤에 있는 LLM의 성능만큼만 좋다는 것을 깨달았습니다. 또한 일반적인 OS 크론을 예약하여 '학교 스킬'을 호출하면 LLM으로 전송되는 토큰 수가 10K에서 약 600으로 줄어듭니다. VPS/OpenRouter에서 OpenClaw를 실행하고는 있지만, 아직은 최선의 활용법은 아닌 것 같습니다.
로컬 모델의 순위를 매기기 위해 지난 몇 년간 Claude, OpenAI, Grok, Gemini 같은 거대 모델들로 해결해야 했던 문제들을 모았습니다. 이들은 우리가 대화하는 모든 것을 기록해 주지만 로컬은 아니죠. 하지만 이번에는 몇 가지 문제를 수집하고 루브릭(평가 기준)이 포함된 프롬프트로 변환할 기회가 되었습니다.

