구형 PC와 GPU 업그레이드로 홈 서버 구축. Qwen 3.8 27B 모델이 초당 약 30 토큰으로 돌아감.
Built a home server from an old PC with GPU upgrade. Qwen3.8 27B runs at ~30 tokens per second.
핵심 요약
구형 PC에 채굴용 GPU(CMP 50HX)를 장착해 가성비 AI 서버를 구축하고, 드라이버 패치와 최적화로 Qwen 27B 모델을 원활하게 구동함.
- 하드웨어 구성 — i7-4790K와 30GB VRAM(CMP 50HX 2개) 조합으로 가성비 구축함.
- 드라이버 패치 — 커스텀 패치를 통해 채굴용 GPU의 성능 제한을 해제하고 PCIe 2.0을 활성화함.
- 성능 최적화 — Qwen 27B 모델을 초당 30~35 토큰 속도로 구동하며 대용량 컨텍스트를 지원함.
- 기술적 난관 — 리눅스 RAM 캐시 관리 및 Llama-server의 설정 한계를 커스텀 런처로 해결함.
프로젝트 하나 돌리려고 적당히 쓸만한 AI가 필요했음. 거창한 건 아니고 그냥 프로젝트 파일들 읽게 해서 버그나 좀 찾게 하려고 했거든. 마침 안 버리고 굴러다니던 구형 컴퓨터가 하나 있어서, 이걸 깃 서버(가끔 마크 서버도 함)로 부활시켜 보기로 했지.
컴 사양은 요즘 기준으로 보면 완전 유물임:
CPU: i7-4790K 4.6 GHz
Motherboard: MSI Z97 Gaming 7
RAM: 32 GB DDR3 2400
PSU: 750 W
근데 컴퓨터 정비하다가 일이 꼬임. 그래픽카드인 GTX 1070이 과열되길래 서멀 재도포 좀 하려고 했거든? 근데 쿨러 나사가 완전히 뭉개져 있는 거야. 억지로 풀다가 드라이버로 기판 긁어서 중요 SMD 부품 몇 개 날려 먹음. R.I.P. 내 글카.
글카가 없으니까 추론을 전부 CPU로 돌려야 했는데, MoE 모델은 그나마 초당 10~20 토큰 정도 나와서 쓸만했지만, 덴스 모델은 초당 3 토큰도 안 나오더라. GTX 1070으로 테스트도 못 해보고 바로 사망 선고 내림 ㅋㅋㅋ.
중고 장터 뒤져봤는데, AI 실험용으로 쓰기엔 가격이 너무 비싸더라고. 그러다 눈에 들어온 게 채굴용 카드들임. cmp40hx, cmp50hx, cmp70hx, cmp90 같은 게 널려 있었는데, 한 달 전만 해도 가격이 꽤 괜찮았거든. 죽은 글카 대신 싸게 때우기엔 딱이었지.
본격적으로 빌드 짜면서 적당한 속도로 AI 돌리려면 VRAM이 얼마나 필요한지 계산해 봤음. 이 서브레딧 보고 영감 받아서, 20GB 메모리에 PCIe 16레인으로 개조된 cmp50hx를 질렀지. 그러고 나서 얼마 안 있다가 개조 안 된 놈(10GB, PCIe 4레인)도 하나 더 샀음. 합쳐서 VRAM 30GB 확보 완료. 카드 두 장 합쳐서 250달러 들었음(이것도 한 달 전 얘기고, 지금은 갑자기 가격 두 배 뜀).
운 좋게도 그쯤에 채굴 카드 연산 성능 제한을 거의 다 풀어버리고 PCIe 2.0까지 지원하게 해주는 드라이버 패치가 나왔더라고(원래 얘네 PCIe 1.1임).
처음엔 새로 나온 cmp50hx 드라이버 패치 써봤는데, 결과는 개판이었음. 드라이버 잡느라 시간 엄청 날림. 패치가 나온 지 얼마 안 돼서 20GB 버전 대응이 안 됐거든. 나중에 제작자가 수정하긴 했는데, 그래도 다른 문제 때문에 드라이버가 안 먹히더라. 자세한 건 말 안 할게, 머리 아프니까.
드라이버 깃허브 이슈 탭 뒤지다가 다른 유저가 올린 가이드를 찾았음.
결국 드라이버 잡았고, 카드 인식도 잘 되고 PCIe 2.0도 돌아감. 근데 문제가 아예 없는 건 아님. 가이드 작성자가 PCIe 2.0 지원은 X99 칩셋에서만 확인됐다고 하더라고. 내 Z97에서도 돌아가긴 하는데, 컴퓨터 절전 모드 풀면 드라이버가 완전히 뻗어버림. 좀 찾아보니까 PCIe 패치 쪽 문제더라고. 그냥 절전 모드 끄니까 해결됨. :)

