이 클러스터(512GB RAM 4대 + 듀얼 AMD Epyc)에서 GLM5.2 같은 거대 모델을 돌릴 수 있을까요? 16채널 메모리로 노드당 409GB/s가 나올 것 같습니다.
Is it possible to run a giant model like GLM5.2 on this cluster (4x servers with 512GB RAM + dual AMD Epyc)? 16 channel memory should hit 409GB/s per node.
핵심 요약
CPU 전용 서버 클러스터에서 거대 모델 추론을 시도하려는 작성자에게 메모리 대역폭과 네트워크 병목 현상에 대한 조언이 이어짐.
- 하드웨어 사양 — 듀얼 EPYC 프로세서와 16채널 메모리를 갖춘 Dell C6525 서버 4대 구성
- 메모리 대역폭 — 노드당 409GB/s의 이론적 대역폭을 확보했으나 노드 간 연결이 병목이 될 가능성 높음
- 추론 전략 — llama.cpp의 RPC 백엔드를 활용한 파이프라인 병렬화 방식이 권장됨
- 성능 제약 — CPU 전용 환경에서는 NUMA 노드 최적화와 스레드 고정이 필수적임
다들 안녕,
전통적인(GPU가 아닌) 서버 관점에서 꽤 빠른 하드웨어가 하나 있는데, 사양은 다음과 같아:
- Dell C6525 쿼드 노드 서버 (서버 블레이드 4개):
- 2x AMD EPYC 7702 64코어 프로세서
- 소켓당 8 메모리 채널, 총 16채널, 512GB DDR4 RAM 3200MT/s
- 참고: 계산해보니 3200MT/s 16채널은 총 409.6 GB/s의 메모리 대역폭임
- 24x 3.84TB SATA12G SSD (서버당 6개), 12GB씩이라 꽤 빠름
- GPU 없음
- 4x Broadcom BCM57504 NetXtreme-E 10Gb/25Gb/40Gb/50Gb/100Gb/200Gb 이더넷 (RDMA 지원)
- 위 사양은 서버당 기준이고 총 4대가 있으니, 총 2TB RAM임
여러 서버에 걸쳐 더 큰 모델을 클러스터링해서 a) 모델 토큰 속도를 높이거나, b) 더 큰 모델을 로드하는 영상들을 봤어.
내 경우에 4개 시스템을 모두 클러스터링해서 각 시스템에 Unsloth 4bit GLM 5.2 (467GB)를 로드해 토큰 속도를 높이는 게 가능할까? 아니면 2개 클러스터로 나눠서 각 클러스터에 Unsloth GLM 5.2 8bit (820GB)를 로드해 속도와 모델 크기를 모두 잡는 건 어떨까?
결과적으로는 GLM 5.2 같은 거대 모델을 이 하드웨어에서 최대한 빠르게 로드하고 싶어. CPU 전용인 건 알지만, 노드당 409GB/s의 메모리 대역폭이 나오니 4개 노드에 분산하면 어느 정도 괜찮을 것 같거든. 이 하드웨어로 낼 수 있는 최상의 성능을 확인하고, 일반적인 에이전트 코딩 하네스로 테스트해보고 싶어.
어떻게 하면 좋을지 아이디어 있는 사람?
피드백과 조언 미리 정말 고마워!


