M5 Ultra 80코어에서 GLM-5.3-Flash의 DwarfStar 속도
M5 Ultra 80Core GLM-5.3-Flash on DwarfStar Speeds
핵심 요약
M5 Ultra 80코어 Mac Studio에서 GLM-5.3-Flash 모델을 구동한 성능 테스트 결과와 하드웨어 병목 현상에 대한 논의.
- 성능 테스트 — M5 Ultra 80코어 환경에서 GLM-5.3-Flash 모델의 추론 속도 측정함.
- 하드웨어 병목 — 256GB RAM은 충분하지만 GPU 성능이 대용량 모델 구동 시 병목이 될 수 있음.
- 컨텍스트 성능 — 300K 컨텍스트에서도 짧은 컨텍스트 속도의 90%를 유지하는 점이 인상적임.
- 하드웨어 비교 — DGX Spark 등 다른 하드웨어와 성능 및 비용 효율성을 비교함.
M5 Ultra 256GB 80코어 Mac Studio로 이것저것 모델 돌려보고 있는데, 에이전트 추론 여러 번 돌려본 결과는 대충 이래.
성능은 꽤 만족스러워. 램 용량 넉넉한 건 진짜 좋네. 근데 이 램 용량에 비해 GPU가 좀 딸리는 느낌이야. AI 추론용으로 512GB 모델 사는 게 의미가 있나 싶다. 어차피 GPU가 확실한 병목 구간이 될 게 뻔하거든.


