Deepseek V4 Flash-0731을 130-150 tks로 돌리는 지루한 방법 - PLX88096 스위치 2개로 연결된 16x5060ti 16GB
The boring way to run Deepseek V4 Flash-0731 130-150 tks - 16x5060ti 16GB over 2 PLX88096 switches
핵심 요약
16개의 RTX 5060 Ti를 연결해 1만 달러 미만의 비용으로 고성능 AI 추론 환경을 구축한 괴물 같은 시스템입니다.
- 하드웨어 구성 — 16개의 RTX 5060 Ti 16GB와 PLX 스위치를 활용한 고밀도 GPU 클러스터 구축함
- 성능 지표 — 텐서 병렬 8, 파이프라인 병렬 2 설정 시 초당 140 토큰 수준의 추론 속도 달성함
- 비용 효율성 — RTX 6000 Pro 가격의 60% 수준으로 2배 이상의 연산 성능을 확보함
- 기술적 난제 — 커스텀 all-reduce 및 DSpark를 활용한 복잡한 파이프라인 병렬 최적화 수행함
| Component | Validated configuration |
|---|---|
| Motherboard | ASRock Rack SPC621D8U-2T/OVH |
| CPU | Xeon Gold 6330 (Get gold/platinum if interested in Optane Pmem gimmicks) |
| GPU fabric | Two Broadcom/PLX PEX88096 islands, eight GPUs per island |
| GPUs | 16 x RTX 5060 Ti 16 GB |
| OS | Ubuntu 22.04.5 LTS |
| Kernel | 6.8.0-106-generic |
| NVIDIA driver | Aikitoria patched open driver 610.43.02-p2p |
| Required BAR1 | 16,384 MiB on every GPU |
-
UEFI 부팅 활성화, CSM 비활성화.
-
Secure Boot 비활성화. 직접 빌드한 EFI 애플리케이션이랑 패치된 NVIDIA 모듈은 서명 안 되어 있음.
-
Above 4G Decoding 활성화.
-
MMIO High Granularity는
1024G로 설정. -
MMIO High Base는
56T근처로 설정. -
이 장비에서 SR-IOV는 비활성화.
-
GRUB 설정:
intel_iommu=off pci=realloc=on,hpmmioprefsize=512G -
NVIDIA 모듈 설정:
NVreg_EnableResizableBar=1 -
사이즈 코드
14를 설정해서 GPU 16개 각각에 16 GiB BAR1 할당. -
리눅스가 재할당할 수 있게 PCI 메모리 디코딩을 잠시 끄고 기존 BAR1 주소를 날려버림.
-
PLX 스위치 ACS 제어 레지스터: 모든 PLX/PEX 브리지에 대해 ECAP_ACS+0x6.w = 0000 쓰기.


