바퀴 달린 데이터 센터: 256GB VRAM/512GB RAM AI 서버 6~8개월 운영 후기, 안정성 및 벤치마크
"Data center in a Box (on Wheels)" 256Gb VRAM/512Gb RAM AI Server 6-8 Month Operational Review, Stability Write Up, Benchmarks
핵심 요약
IT 엔지니어가 10개의 GPU를 장착한 고성능 AI 서버를 직접 구축하고 8개월간 운영하며 얻은 하드웨어 구성과 안정성 노하우를 공유함.
하드웨어 구성 — 3090 8개와 5090 2개를 조합한 256GB VRAM의 강력한 AI 워크스테이션 구축
운영 안정성 — PCIe 레인 분할과 전력 제한 설정을 통해 1.6kW 수준의 전력으로 안정적인 추론 환경 구현
공간 및 냉각 — Thermaltake Core W200 케이스를 활용해 10개 GPU의 발열을 효과적으로 제어
실무 활용도 — 로컬 LLM을 활용해 코딩, 데이터 분석 등 업무 생산성을 획기적으로 개선
한동안 이 포럼에 안 들어왔는데, 이제 어느 정도 운용도 해봤으니 정보 공유 차원에서 공식적으로 업데이트 좀 하려고 한다. 원래 썼던 글은 퀄리티가 영 마음에 안 들어서 지워버리고 이걸로 대체할 생각임. 본업이 IT 인프라 엔지니어라 이론적인 머신러닝 관점보다는 하드웨어/시스템 관점에서 썰을 풀어보려고 한다. 대학에서 물리학 전공할 때 HPC(Beowulf 클러스터)로 처음 입문했으니, 거의 10년 만에 이런 괴물을 만들게 됐네. 다 읽기 귀찮은 사람들은 그냥 넘겨도 상관없다. 밑에 적힌 내용들은 정보 필요한 사람들을 위한 거니까.
시작 목표/아이디어:
소규모 사업체를 지원할 올인원 머신 구축. 이 기계는 최신 MoE 모델을 효과적으로 추론할 수 있어야 하고, 영어가 모국어가 아닌 사람들을 위한 언어/텍스트 작업, 데이터 분석, 심층 주제 연구를 도와야 함. 추가로 그래픽 디자인 사용자를 위한 이미지 생성 툴을 동시에 돌려서 빠른 이미지 편집과 마케팅용 프레젠테이션 보조가 가능해야 함. API 크레딧이나 사용량 제한 걱정 없이 마음껏 쓸 수 있게 말이지. 3090 스택(LLM용으로 여전히 "좋은" 기본 성능)에 5090 하나를 대장으로 붙여서(대용량 입력 시 프롬프트 처리 최적화 + VRAM 확보) 고급 LLM 워크로드를 처리하고, 나머지 5090 하나는 다른 창작 작업용으로 남겨두는 구상이다. 결과적으로 이 목표는 달성됐다고 본다.
스토리지: 4Tb Nvme (빠름) + 4Tb HDD (느림) + 필요에 따라 USB로 연결한 1Tb SATA SSD 8개 정도 (중간)
OS: Ubuntu 25.10
기타: Bifurcation 카드 3개, 다양한 길이의 라이저 10개
프론트엔드: Open WebUI
백엔드: llamacpp/koboldcpp
추천 대상:
대규모 MoE 추론, LLM과 ComfyUI 동시 구동, API 크레딧 제한 자주 걸리는 파워 유저, 생산성을 극대화해서 업무 시간을 단축하려는 창작자나 기술 전문가.
비추천 대상:
학습(Training), 다중 동시 추론, 성능 극한까지 뽑아내기, 고양자화 상태의 최신 모델 추론, 그냥 롤플레잉이나 하려는 라이트 유저.
결과 요약:
W200 케이스가 워낙 넓고 구성이 자유로워서 카드 10장이랑 부품들 다 때려 박아도 큰 문제 없었음. 드라이브 베이 쪽 공간을 GPU 장착용으로 싹 다 개조해야 했지만, 우리한텐 별일 아니었다. 사진으로 보면 좀 좁아 보이는데, 사실 카드들이 위에서 매달려 있는 공간은 꽤 널널함. 전면이랑 측면에 140mm 팬을 도배해놔서 바람이 앞이랑 옆에서 들어와 뒤/위로 빠지는 윈드 터널 효과가 제대로 나온다. 실내 온도에 따라 다르지만, 아이들 상태에서 제일 뜨거운 카드가 40도 중후반, 제일 낮은 건 20도 중반 유지함(3090 3개는 하이브리드 모델이라 온도 잡기 개꿀인데, 라디에이터 달기가 좀 귀찮음). 본격적으로 추론 돌릴 때도 제일 뜨거운 카드가 60도 중반 정도 찍는다. ComfyUI로 이미지나 영상 생성할 때만 5090이 70도까지 올라가는데, 어차피 계속 돌리는 게 아니라서 이 정도면 충분히 만족스러운 수준임.
결과물을 보고 놀랐거나 기억에 남는 점들:
소음. 작동할 때 제트기 이륙하는 소리 날 줄 알았는데 전혀 아님. 전원 켤 때 나는 버튼 클릭 소리는 꽤 만족스럽고, 그 뒤로는 낮고 부드러운 웅웅거림만 들림. 서버실에서 듣던 그런 팬 소음이랑은 차원이 다름. 부하 걸려도 상단 배기로 나가는 CPU 120mm 라디에이터 팬 소리 정도만 들리고, 전면이랑 측면에 달린 140mm 팬들이 소음을 잘 잡아주는 듯함. 그동안 게이밍 PC 많이 조립해봤고 지금도 하이엔드급 하나 쓰고 있는데, 특히 아이들 상태일 때 이거보다 더 시끄럽다고 느껴지진 않음.
활용성. 원래는 작은 크리에이티브 비즈니스 용도로 쓰려고 했는데, 내 개인적인 직장 생활에서 이렇게까지 필수템이 될 줄은 몰랐음. 인프라 엔지니어라 코딩은 내 주특기가 아님. 현장에 IT 담당자가 나 혼자뿐이거나 SQL, 파워쉘/파이썬 스크립트, 혹은 아주 특수하고 마이너한 기술 문제 해결할 사람이 없을 때, 이 장비가 대기하고 있다는 것만으로도 이미 내 커리어에서 본전은 다 뽑았다고 봄. 몇 시간 걸릴 작업을 몇 분 만에, 며칠 걸릴 걸 몇 시간 만에, 심지어 몇 달 걸릴 걸 몇 주나 며칠 단위로 줄여줬음. 이 툴을 빡세게 써보니까 로컬 LLM이 이제 단순한 장난감이나 신기한 물건 수준을 확실히 넘어섰다는 걸 인정할 수밖에 없었음. 똑똑하게만 배치하면 전문가들한테 진짜 엄청난 자산이 됨.
바퀴. 별거 아닌 거 같지? 근데 그래픽카드 온도가 아무리 착해도 고성능 GPU 10개가 방 안으로 뿜어내는 열기는 어쩔 거임. 복잡한 라디에이터 솔루션이나 별도의 배기 시설 없으면 방 안은 금방 찜질방 됨. 근데 바퀴가 있으면 간접적인 해결책이 됨. 오늘은 사무실에서 일할 거다? 그럼 게스트룸으로 밀어 넣고 와이파이로 돌리면 됨. 집 밖에서 일할 거다? 그럼 사무실로 밀어 넣고 랜선 꽂은 다음 개인 VPN으로 접속하면 끝임. 방이 뜨거워지는 걸 못 막겠으면, 적어도 어느 방을 뜨겁게 만들지는 선택할 수 있다는 거임. 컴퓨터랑 평생을 같이 살아온 입장에서 이거 진짜 저평가된 개꿀 기능임.
주의사항: 최상의 성능을 내려면 공기 흐름을 위해 측면 유리 패널은 떼어놓는 걸 추천함.
하루 평균 사용 패턴:
오전 5시 30분쯤 부팅해서 ComfyUI 서버 띄우고 모델 로딩 시작함. 그 사이에 커피 한 잔 타오면 15~20분 안에 바로 쓸 준비 완료됨. 보통 저녁 8시쯤 끄고. 하루 총 가동 시간은 대략 12~14시간 정도.
비용 내역
물어볼 거 뻔해서 정리해둠. 물론 지금 시장 상황에선 똑같이 맞추는 게 불가능하다는 건 나도 잘 알고 있음. SSD 같은 일부 부품은 램이랑 하드웨어 가격 폭등하기 한참 전에 개인적으로 구한 거라 예산 면에서 운이 진짜 좋았음. 어떤 건 정확한 금액이고, 어떤 건 영수증 찾기 귀찮아서 대충 반올림한 거임.
Component
Qty
Source
Unit Cost
Subtotal
RTX 3090 24Gb
8
eBay
750-1000
6500
RTX 5090 32Gb
2
Retail
2500-3000
5500
TR 3995WX
1
eBay
1068.43
1068.43
WRX80E-SAGE-SE
1
Amazon
949.99
949.99
DDR4 ECC 64Gb
8
Amazon
81.99
695.28
TT Core W200
1
Amazon
499.99
499.99
PSU 1300/1600
2
Amazon
250-350
600
4Tb nvme
1
Amazon
221.05
221.05
1Tb SSD
8
Personal
60
600
Risers (varying length)
10
Amazon
40-80
480
Bifurcation cards
3
Amazon
50
150
Total
~$17k
문제점/안정성 리포트
공간 문제:
이런 걸 시도할 때 가장 먼저 부딪히는 큰 벽은, 이론적으로라도 하드웨어에 무리가 가지 않게 카드 10장을 케이스 하나에 어떻게 구겨 넣느냐는 거임. 처음엔 채굴기 프레임 개조할까도 생각했는데, 구조적으로 좀 더 튼튼하면서 통풍도 잘 되고, 어느 정도 들고 다닐 수 있는 놈을 원했거든. 아쉽게도 내가 상상한 구성에 맞는 선택지가 별로 없더라고. 캐비닛이나 확장형 타워 케이스도 이것저것 찾아봤는데, W200의 듀얼 풀 타워 챔버 디자인만이 이 아이디어를 실현할 수 있는 유일한 답이었음. 다른 해결책도 분명 있겠지, 이동성까지 고려한 놈들도 있을 거고. 근데 W200만큼 케이스 크기, 공간 확보, 엄청난 공기 흐름, 그리고 어느 정도의 휴대성까지 다 챙긴 놈은 없었음. 공간 문제 해결하려면 W200 추천함. 구할 수만 있다면 말이지.
바이퍼케이션(Bifurcation) 문제:
이런 거 조립하다 보면 마주칠 또 다른 난관이 바로 바이퍼케이션 카드임. 이 카드들은 제대로 작동하려면 특정 BIOS 설정이 필요한데, 모든 걸 연결하기 전에 이 설정을 안 해두면 시스템이 멈춘 것처럼 화면이 안 나오거나, OS에서 카드가 아예 인식이 안 될 수 있음. 일단 바이퍼케이터 없이 슬롯에 GPU 하나만 꽂고 시작해. BIOS 들어가서 나눌 슬롯들을 수동으로 바이퍼케이션 모드로 설정하는 거임. 그 김에 Above 4G Decoding, Resizable BAR, SR-IOV도 전부 활성화해 둬. 우분투에서 GPU 여러 개 쓸 때 이게 제일 안정적이더라. 라이저 카드를 쓴다면, 특히 세대가 섞여 있다면, 각 PCIe 슬롯의 Gen이랑 레인 속도를 BIOS에서 수동으로 고정하는 걸 강력 추천함. 그래야 시스템이 각 카드랑 제대로 통신할 수 있거든. 라이저 Gen/속도를 비슷하게 맞춰서 특정 카드가 다른 놈들보다 느려지는 걸 방지해야 함. 이게 추론 성능에 직접적인 영향을 주진 않아도 모델 로딩 속도에는 엄청난 차이를 만듦. 물론 이 구성으로 모든 카드를 항상 최고 Gen 대역폭으로 돌릴 순 없겠지만, 200GB가 넘는 모델을 Gen 3/4 x8/x16 속도로 로딩하는 게 시스템이 멋대로 Gen 1 x1로 돌리는 것보다 훨씬 빠르다는 건 확실함.
전원 "문제":
전력과 발열 문제는 이 프로젝트를 향한 회의적인 시선 중 가장 큰 비중을 차지하는 부분이라 여기서 따로 짚고 넘어갈 필요가 있겠네. 솔직히 말해서 대부분의 상황에서 이런 걱정이 드는 건 당연해. 만약 이 카드 10장이 전부 TDP 근처까지 전력을 끌어다 쓰면서 계속 돌아간다면, 부품들이 다 녹아내릴 거야. 불이 날 수도 있고, 이웃들이 이상한 눈으로 쳐다보겠지. 하지만 실제로는 2900W 파워 용량 중에서 지속적인 부하가 걸려도 1400~1600W 정도만 사용되는데, 이건 GPU 간 대역폭 병목 현상 덕분이야. 어떻게 보면 이게 카드들의 전력 소모를 알아서 조절해 주는 자연스러운 제어 장치 같은 건데, 그냥 물리 법칙일 뿐이지 무슨 마법 같은 게 아니야. MoE 모델을 GPU 스택에 나눠서 올리면, 순방향 연산(forward pass)을 할 때마다 PCIe를 통해 모든 통신이 이루어져야 하거든. 그래서 GPU들은 실제로 연산을 하는 시간보다 이전 GPU에서 정보를 받아오길 기다리는 시간이 더 길어. 즉, 모든 부품을 풀가동해서 수천 와트씩 퍼먹을 필요 없이, LLM 구동 시 1400~1600W 정도로 훨씬 관리가 쉬워진다는 거지. 이건 20A/120V 회로(최대 2400W)에서도 충분히 감당 가능한 수준이야. GPU 하나하나 놓고 보면 카드를 "제대로 못 쓰는" 거라 비효율적으로 보일 수도 있겠지만, 노드 전체로 보면 오히려 엄청나게 효율적이라고 볼 수 있어(모든 카드를 "풀"로 썼을 때 4500W 이상 나오는 거랑 비교하면 1600W 정도면 선방하는 거니까). 예방 차원에서 3090은 전력 제한을 200W로, 메인 5090은 400W로 걸어둘까 생각 중인데, 실제로 카드 10장을 다 LLM 작업에 할당해도 3090은 100~120W, 5090은 100W 미만으로 먹어서 굳이 안 해도 될 것 같기도 해. 다음 섹션에서 다룰 클럭 고정 설정이 안정성 문제를 피하기 위해 훨씬 더 실질적으로 필요한 작업이라고 보면 돼.
순간 전력 급증(Transient Spike) 문제 (안정성에 필수):
컴퓨터 조립 다 끝냈다고 바로 테스트 돌리고 싶겠지만, 무시했다간 큰코다칠 수 있는 설정이 하나 있어. 시스템에서 추론 작업을 돌리고 있다고 상상해 봐. 입력값이 엄청 크거나 출력값이 길게 나올 때, 한창 생성 중인데 갑자기 시스템이 재부팅되는 거지. 전원이 팍 꺼지는 것도 아니고, 파워 OCP가 터진 것도 아니고, 차단기가 내려간 것도 아니야. 직전에 nvitop으로 확인했을 때 카드들이 TDP의 25~33%밖에 안 쓰고 있었으니 겉보기엔 이유를 알 수가 없지. 이유는 이거야: 고전력 GPU 10장이 연산 덩어리를 처리하려고 정확히 동시에 작동하기 시작하면, 평균 전력 소모량은 낮더라도 순간적으로 전력이 튀면서 메인보드 전압을 떨어뜨려 시스템 재부팅을 유발할 수 있거든. 해결책은 간단해. 언더볼팅이야. nvidia-smi를 써서 3090은 클럭을 1200으로, 메인 5090은 2000으로 고정하면 돼. 이미지 생성용 5090은 건드리지 말고 놔둬서 ComfyUI가 빡세게 돌릴 때 제 성능 다 나오게 해주고. 끝이야. 내 경우에는 이 설정으로 며칠 내내 수십만 토큰이랑 이미지를 돌려도 시스템이 아주 안정적이었어. 정확한 설정값은 그날그날 무슨 작업을 하느냐에 따라 조금씩 달라지겠지만, 예를 들어 카드 10장 전부(5090 2장 포함)로 LLM을 돌리고 싶다면 전력 급증을 막기 위해 이렇게 설정하면 돼:
sudo nvidia-smi -pm 1 #enables persistent mode
sudo nvidia-smi -i x,y,z --lock-gpu-clock=1200,1200 #x,y,z for index number of 3090s
sudo nvidia-smi -i a,b --lock-gpu-clock=2000 #a,b for index number of 5090s
sudo nvidia-smi -i x,y,z -pl 200 #x,y,z for 3090 index numbers, limits power to 200w
sudo nvidia-smi -i a,b -pl 400 #a,b for 5090 index numbers, limits power to 400w
동시 사용 문제:
보통 한 기기에서 추론이랑 이미지 생성을 동시에 돌리려고 하면 시스템이 뻗어버리기 십상임. 듀얼 GPU 시스템조차도 CPU나 메인보드 구조 때문에 제대로 안 돌아가는 경우가 태반이고, 설령 돌아간다 해도 VRAM 용량 때문에 한계가 명확하거든. 근데 우리처럼 10개짜리 GPU 세팅에 64코어 3995WX의 레인 오케스트레이션까지 갖추니까 이게 의외로 잘 버티더라. 핵심은 GPU를 수동으로 할당할 수 있는 LLM 백엔드를 찾는 건데, 우리 같은 경우엔 llamacpp 기반의 koboldcpp가 딱이었음. 먼저 위에서 말한 전력/클럭 설정을 적용하고, koboldcpp를 켠 다음, 돌리고 싶은 모델의 GGUF 파일을 불러와서 컨텍스트 사이즈를 설정해. VRAM이 충분하다면 GPU 레이어 수를 모델 전체 레이어 수로 수동 설정하고, GPU ID는 "all"로 맞추는 걸 추천함. 하드웨어 탭에서 텐서 분할(tensor split) 항목을 찾아서 각 카드 인덱스에 맞춰 할당할 용량을 입력하면 됨. 예를 들어 ComfyUI용 5090이 3번, LLM용 5090이 5번이라면, Comfy용 5090에 레이어가 안 들어가게 하려면 텐서 레이어 라인을 이렇게 짜면 됨: 24,24,24,0,24,32,24,24,24,24. 프롬프트 처리를 원활하게 하려면 "main GPU"를 "메인" 5090의 인덱스(여기선 5)로 설정하고 앱을 실행해. 모델이 로드되면 터미널 하나 더 열어서 ComfyUI를 띄우면 됨. 우리 경험상 실행 플래그를 따로 안 건드려도 시스템이 알아서 노는 5090을 잡긴 하는데, 혹시라도 특정 GPU를 강제로 쓰게 하고 싶으면 플래그(--cuda-device i)를 쓰면 됨. 일단 이미지 모델이 5090에 올라가면, 다른 카드들이 추론하는 도중에 모델을 내렸다가 새로 올리지 않는 이상 PCIe 통신에 간섭할 일은 없음. 결과적으로 한 시스템에서 언어 작업이랑 창작 작업을 통합 워크플로우로 돌릴 수 있는 환경이 완성되는 거지. 동시 사용을 가능하게 하는 해결책은 결국 레인 수가 많은 CPU, 다수의 그래픽 카드, 그리고 하드웨어끼리 꼬이지 않게 실행할 때 조금만 신경 써서 자원을 배분하는 거임. 다른 제조사나 모델로 이 세팅이 얼마나 잘 먹힐지는 솔직히 모르겠음. 이미지/비디오 생성 작업은 보통 그냥 제일 좋은 GPU 하나 박는 게 장땡이니까. 5090보다 성능이 떨어지는 카드들로 구성된 균일한 GPU 클러스터에서 이 세팅이 얼마나 실용적일지는 나도 잘 모르겠다. 우리가 굳이 이 방식을 택한 건 LLM용으로는 3090의 "적당한" 가성비를 챙기고, 생성 작업용으로는 5090의 "최신" 성능을 뽑아내기 위해서였거든. 그래서 딱히 비교할 만한 대상이 없네.
이걸로 어떤 모델들을 돌릴 수 있고, 우리는 뭘 쓰냐고?
거의* 다 돌아감. Kimi K2 같은 1T 파라미터 모델까지도 가능함. 이론상 Kimi K3도 로드는 되겠지만, 성능 지표를 보니까 DRAM까지 끌어다 써야 해서 실사용은 무리일 것 같아 시도할 생각 없음. 대신 Bartowki 팀의 Kimi K2 1-4비트 퀀트 모델은 순수 VRAM이랑 VRAM/RAM 혼합 환경에서 테스트해 봤는데 결과가 꽤 괜찮았음. 돌아가긴 하고 분명 쓸 데도 있겠지만, 우리 기기에서 파라미터 크기랑 퀀트 품질을 고려했을 때 가장 밸런스 좋은 건 300b~600b 범위 모델들이더라고. 개인적으로는 Deepseek, GLM 4.7, Nemotron Ultra를 제일 좋아함. ComfyUI 쪽은 32Gb 버퍼 안에만 들어가면 거의 다 잘 돌아가는데, 그중에서도 Qwen image를 제일 자주 씀.
Benchmarks
모든 모델은 동일한 7개의 대형 입력 프롬프트 세트를 거쳤고, 각 모델이 토큰 입출력과 프롬프트 처리/생성을 어떻게 다루는지 기록했어. 여기서 내가 쓴 프롬프트를 다 깔 수는 없지만, 각 프롬프트는 사이버 보안 시나리오와 관련이 있고 모델의 분석 깊이, 답변 퀄리티, 그리고 복잡한 문제를 해결하는 능력을 관찰했어. 이 테스트는 내가 언급한 언더볼팅/전력 제한 전략을 사용해서 10개 카드 전체에서 추론을 돌렸어. 그래서 다른 환경의 동일 하드웨어에서 나오는 절대적인 최고 성능을 반영하는 건 아닐 수도 있지만, 이 장비가 무리 없이 소화할 수 있는 수준을 보여주는 스냅샷이라고 보면 돼.
Model Name
Deepseek V3.2 671b Q2XXS
Nemotron Ultra 3 550b IQ2XXS
Qwen 3.5 397b IQ4XS
GLM 4.7 358b Q4KXL
Deepseek V4 Flash 294b Q8KXL
Model Size (Gb)
217.1
193.8
189.7
204.6
161.9
P1 Input
2769
2744
2729
2706
2733
P1 Output
813
786
1046
872
693
P1 pp
153.23
254.19
522
687.88
111.09
P1 tg
19.35
17.32
34.38
23.98
7.2
P2 Input
14635
15255
15160
14527
14640
P2 Output
1150
1302
1665
1194
1222
P2 pp
114.83
429.42
897.57
640.8
66.42
P2 tg
14.1
17.16
33.15
18.83
5.96
P3 Input
3966
3091
3054
3033
3073
P3 Output
1217
1607
1550
1056
1199
P3 pp
98.01
353.78
649.37
516.08
47.79
P3 tg
13.22
17.08
32.84
17.84
5.56
P4 Input
5645
5654
5623
5559
5650
P4 Output
1178
1996
1619
1173
1705
P4 pp
70.3
385.04
739.67
419.58
42.4
P4 tg
13.47
16.99
32.23
16.87
5.21
P5 Input
4498
4505
4493
4423
4481
P5 Output
280
928
1078
473
665
P5 pp
72.4
365.46
670
408.93
36.2
P5 tg
8.43
16.78
31.55
15.45
4.86
P6 Input
9266
9367
9241
9172
45287 (reload)
P6 Output
1004
1883
1466
933
1205
P6 pp
53.94
405.13
738.57
379.7
46.01
P6 tg
11.48
16.83
30.98
14.01
4.41
P7 Input
3136
3124
3118
3057
3118
P7 Output
1378
1946
1629
1359
1353
P7 pp
53.34
338.64
525.54
344.88
28.38
P7 tg
10.45
16.73
30.66
13.59
4.28
Final token count
50052
54182
53465
49531
50962
테스트 후 각 모델에 대한 내 메모:
Deepseek V3.2-- 좀 구형 모델인데도 여전히 엄청나게 쓸만함. 컨텍스트가 수만 토큰까지 늘어져도 고퀄리티의 통찰력 있는 답변을 유지했음.
Nemotron Ultra 3-- 처음 써봤는데 인상이 아주 좋았음. 55개의 활성 파라미터가 여기서 제대로 힘을 발휘함. 전체 파라미터 수는 더 적은데도 Deepseek v3.2 수준이거나 그 이상임.
Qwen 3.5 397b-- "좋은" 모델의 기준점이라고 생각하는데, 테스트한 다른 대안 모델들한테 좀 밀리는 감이 있음.
GLM 4.7-- 파라미터는 더 적은데도 Qwen보다 나아 보였음(GLM의 활성 파라미터가 이점인 듯). 덩치 대비 아주 탄탄한 옵션임. Nemotron이나 Deepseek 급은 아니지만, 최신 버전들보다 "저렴한" 대안으로 아주 훌륭함.
Deepseek V4 Flash-- 여러모로 충격적이었음. 테스트한 모델 중 "가장 작음"에도 불구하고 놀라울 정도로 정교하고 분석 능력이 뛰어남. "무손실" 모델을 풀 정밀도로 돌린 덕분인가? 다른 모델들이 다 놓친 뉘앙스와 디테일을 잡아내고, 덩치가 두 배 이상 큰 모델들보다 더 세밀한 통찰력을 보여줌. 이 정도 사이즈 모델이 자기 체급보다 훨씬 높은 수준의 성능을 낼 줄은 몰랐음. 물론 다른 모델들에 비해 성능이 떨어지는 부분도 있었는데, 이게 모델 아키텍처 문제인지 내 장비와의 상호작용 문제인지는 확실치 않음. 그래도 속도를 생각하면 결과물 퀄리티는 감수할 만한 수준임.
배운 점/다르게 할 것들
-3090을 구할 때 최대한 같은 모델로 맞췄어야 했음. TDP랑 쿨링 솔루션이 제각각인 모델들을 섞어 쓰니까 온도 편차가 너무 심함.
-학습을 하거나, 더 높은 성능을 뽑아내거나, GPU 10개 이상으로 갈 생각이라면 그냥 30A/240V 전력 증설 예산을 잡아두는 게 나음. 지금 우리 구성처럼 20A 회선에 카드 10개 물리는 건 우리 사용 환경에선 안전할지 몰라도, 이게 마지노선이라고 생각함.
-클럭 고정 스크립트를 진작에 짰어야 했음. 랜덤 리셋 때문에 시간 날리는 걸 방지할 수 있음.
-라이저 카드 주문하기 전에 PCIe 토폴로지랑 GPU 배치(줄자로 유연하게 재가면서)를 미리 문서화하거나 그려두는 걸 추천함. 시행착오를 줄여줌.
최종 생각:
이건 혼자나 소규모 팀이 생산성을 극대화할 수 있게 해주는 바퀴 달린 AI 서버야. 개인 정보 보호와 통제권까지 완벽하게 챙길 수 있지. 20A 회로 하나로도 돌아가고, 한쪽 창에는 비전 기능이 탑재된 고성능 LLM을, 다른 쪽 창에는 ComfyUI를 띄워놓고 5090의 깡성능과 낮은 지연 시간을 어디서든 원격으로 누릴 수 있어. 솔직히 말도 안 되는 아이디어였고, 지금도 여전히 그렇긴 해. 근데 이게 너무 터무니없으면서도 성능이 기가 막히게 잘 나와서, 시간이 지나면 특정 소규모 비즈니스나 개인 전문가들, 심지어 중견 기업이나 대기업에서도 핵심 장비로 자리 잡을 게 눈에 훤해.
물론 지금 당장 쓸 수 있는 "최고"의 LLM들이 클라우드에 있다는 건 인정해. 하지만 오픈 모델들 성능이 미친 듯이 올라오고 있거든(K3나 DS V4 Flash를 봐). 사람들이 지금 클라우드 API로 하는 작업들 중 상당수를 대체할 만큼, 아니면 최소한 "충분히 쓸만한" 수준까지는 올라왔다고 봐. 클라우드는 언제나 선택지 중 하나일 거고 수요도 계속 있겠지만, 데이터 주권이나 끊김 없는 워크플로우, 혹은 보안 규정을 중요하게 생각하는 사람이나 조직한테는 온프레미스 컴퓨팅으로 넘어가는 게 상황에 따라서는 유일한 해결책이 될 수도 있어. 결국 뭐가 더 낫다고 단정 지을 순 없지. 그냥 A에서 B로 가는 방식은 사람마다 취향 차이 아니겠어?
주요 댓글
r/localllama
작성자의 대규모 로컬 AI 서버 구축에 대해 하드웨어적 성취를 높게 평가하면서도, 실제 생산성 측면에서 모델의 지능과 활용 방식에 대한 다양한 의견이 제시되고 있습니다.
67
5번 사진 이상:
0
그치? ㅋㅋ 나도 SST/TTS용으로 하나 돌리고 싶음. 전용으로 말이야. 5060 ti 3~4개 정도 175와트 근처로 고정하고, 3090도 같이. 5060 ti 4개면 대충 2000달러 정도 하겠네. 젠슨이 5000 시리즈 대체할 다음 시리즈 발표하기 전까진 업그레이드 안 할 거임.
0
GPU 착취 공장이자 아동 GPU 노동까지 착취하는 곳이구만.
31
PC 팬이 전부 흡기로 설정되어 있고 배기가 하나도 없네요. 이렇게 고성능 부품이 많으면 체계적이고 직접적인 신선한 공기 흡입과 배기 경로가 있어야 온도가 낮아질 텐데(예: 전면 패널 흡기, 측면 패널 배기, 특히 GPU를 수직으로 장착한 경우, 상단 및 후면 패널 배기), 지금은 부품들이 뜨겁고 탁한 공기를 계속 재순환시키고 있는 상태입니다.
3
이웃들이 곤란한 질문을 할 수도 있겠죠. 하지만 실제로는 2900W PSU 용량 중 1400~1600W 정도만 지속 부하 시 사용됩니다.
그쪽 측면의 120mm 팬과 후면은 배기일 수도 있어요. 어쨌든 수 kW 단위의 부하에 접근하면 섀시는 보통 공기를 밀어내는 팬 벽을 만드는 게 중요해집니다. 공기가 강제로 통과하면서 뜨거운 공기를 제거하기 때문에, 랙 배기를 환경적인 이유로 냉각해야 할 상황이 오기 전까지는 배기 자체가 덜 중요해지죠. 만약 더 필요하다면 녹투아 산업용 팬처럼 RPM이 높은 걸로 교체하는 걸 추천합니다. 저는 반대로 TDP를 낮춰서...
2
기술적으로 맞는 말이긴 한데, 그건 주로 서버용 팬 설정에 해당되는 얘기임. 작성자가 쓰는 일반 소비자용 PC 팬은 정압이 훨씬 약하거든. 일반 팬 쓸 때는 뜨거운 공기가 고이지 않게 배기 구성을 제대로 하는 게 중요함. 오히려 흡기보다 배기가 훨씬 중요함, 배기로 공기를 빼내면 자연스럽게 신선한 공기가 들어오니까. 게다가 PC 케이스는 내부 구조가 워낙 복잡해서...