RTX Pro 2개로 로컬 환경 업그레이드했는데 대박이네요.
Upgraded my local setup with 2 rtx pros and it's amazing.
핵심 요약
RTX Pro 2개를 활용한 로컬 LLM 구축 성공기 및 하드웨어 성능에 대한 사용자들의 반응입니다.
- 하드웨어 구축 — RTX Pro 2개로 로컬 LLM 환경을 성공적으로 업그레이드함
- 성능 체감 — M3 Ultra보다 훨씬 빠른 추론 속도와 효율적인 컨텍스트 처리
- 기술적 도전 — GPU 간 P2P 통신 및 전력 제한 설정으로 최적화 달성
- 커뮤니티 조언 — 파인튜닝 시도 및 데이터셋 활용에 대한 다양한 의견 공유
https://www.reddit.com/r/LocalLLaMA/s/nGMyKswrch 후속 글이다.
댓글 달아준 형들 다들 고맙다. 사양은 안 바꿨어. 메모리 대역폭 좀 손해 보는 거 같긴 한데, 나중에 필요하면 그때 가서 늘리지 뭐.
조립하는 데 2.5일이나 걸렸다. GPU 하나가 부하만 걸리면 전원이 자꾸 나가길래, 문제 찾으려고 케이블 전부 다 다시 꽂느라 개고생했거든. 소프트웨어 개발자라 하드웨어 만져본 게 살면서 세 번째라 제대로 작동할지 걱정했는데, 다행히 잘 돌아가서 기분 좋다. 메인보드랑 파워에서 케이블 뽑느라 손가락 끝이 아직도 얼얼하네.
시스템 성능 제대로 뽑아내려고 GPU 간 피어 투 피어(peer to peer) 통신, cuda graph, 텐서 병렬 처리까지 다 설정했다. GPU 두 개 다 500W로 제한 걸어놨어. 딱히 이유는 없고 그냥 풀로드 돌리기 싫어서.
아, 그리고 온도 너무 높게 치솟고 팬에서 이상한 소리 나길래 케이스 옆판도 그냥 열어버렸다.
지금 돌리는 건 이거야:
-
Qwen 3.8 flash next 8 bit
-
Deepseek v4 flash 0731 (official)
M3 ultra 512도 있는데, LLM 돌려보니까 추론용으로는 진짜 쓸모가 없더라. 느려 터진 거 보고 있으면 머리만 아픔. 반면에 새로 맞춘 이 시스템은 그냥 미쳤다. 디코드 150 tk/s에 프리필 10K tk/s 찍히네.
Qwen도 괜찮긴 한데, 컨텍스트 대부분을 씽킹 토큰(thinking tokens)이 다 잡아먹더라. 이거 안 쓰는 게 나을지 고민 중이야. 컨텍스트 꽉 채우면 동시 요청 처리할 VRAM이 거의 안 남거든. Deepseek 1M 컨텍스트는 진짜 마음에 든다. 동시 요청도 4개까지 거뜬하고. 둘 다 모델 성능은 무난해. 가끔 틀려도 속도가 워낙 빨라서 티도 안 나. 그냥 빠릿빠릿하게 틀리고, 바로 수정하고 넘어가니까 편하네.
드디어 매달 구독료 내면서 5시간 제한 같은 거 신경 안 써도 되는 날이 왔다. 서버에 openclaw, opencode, openweb UI, Tailscale까지 싹 다 세팅 끝냈어.
혹시 Qwen에서 씽킹 토큰 빼고 결과값만 컨텍스트에 넣어서 써본 형들 있냐? 모델 성능이나 정확도에 영향 좀 있어?
그리고 이 시스템에 더 깔아볼 만한 거나, 새로 써볼 만한 모델 추천 좀 해줘.


