DGX Spark를 막 설치했습니다 — vLLM과 로컬 모델을 돌릴 계획인데 조언 부탁드립니다
DGX Spark just arrived — planning to run vLLM + local models, looking for advice
핵심 요약
DGX Spark를 도입한 사용자가 vLLM 기반 로컬 LLM 환경 구축을 위한 최적화 팁과 모델 추천을 구하는 글.
- 하드웨어 설정 — DGX Spark를 활용한 로컬 LLM 추론 환경 구축 및 vLLM 최적화 시도.
- 모델 추천 — 로컬 환경에서 효율적으로 구동 가능한 고성능 모델 정보 공유.
- 성능 최적화 — 통합 메모리 시스템에서의 vLLM 튜닝 및 처리량 극대화 방안 논의.
- 실제 활용 사례 — 교육 및 분석 애플리케이션을 위한 로컬 API 백엔드 구성.
오늘 DGX Spark를 설치했고 로컬 LLM 추론을 위해 설정을 시작했습니다.
계획은 다음을 돌리는 것입니다:
• vLLM
• PyTorch
• Hugging Face 모델
제가 만드는 애플리케이션(교육/분석용, 모든 것을 로컬/비공개로 유지하려고 함)의 로컬 API 백엔드로 사용할 예정입니다.
지금까지는 주로 클라우드 GPU로 작업해왔기 때문에, 이런 환경을 완전히 온프레미스로 돌리는 건 처음입니다.
몇 가지 궁금한 점이 있습니다:
• 이 하드웨어에서 효율적으로 잘 돌아가는 모델은 무엇인가요?
• 이런 통합 메모리 시스템에서 vLLM을 위한 튜닝 팁이 있을까요?
• 실제 처리량은 기대치와 비교해서 어떤가요?
비슷한 환경을 구축하신 분들의 통찰을 공유해주시면 감사하겠습니다.


