2400cc 추론 레이서: RTX 3090 듀얼 엔진, NVLink 터보, 누드 7840U 씽크패드 ECU, 폭스바겐 골프 라디에이터
2400cc Inference Racer: Dual RTX 3090 motors, NVLink turbo, naked 7840U ThinkPad ECU, VW Golf radiator
핵심 요약
씽크패드 메인보드와 RTX 3090 2개, 자동차 라디에이터를 조합해 만든 괴상한 DIY AI 추론 서버.
- 괴상한 하드웨어 — 씽크패드 메인보드와 RTX 3090 2개를 자동차 라디에이터로 냉각함.
- 독특한 냉각 — 폭스바겐 골프용 라디에이터를 활용해 2.4리터 냉각수를 순환시킴.
- 추론 성능 — vLLM을 통해 Qwen3.8-27B 모델을 구동하며 준수한 속도를 보여줌.
- DIY 정신 — PCIe 슬롯 개조와 BIOS 패치로 불가능해 보이는 구성을 실현함.
오늘 내가 아주 기가 막힌 공학적 걸작을 하나 들고 왔다. 커스텀 칩보드 섀시 안에 정성스럽게 조립한, 일명 2400cc 인퍼런스 레이서이자 내 겨울철 난로다.
동력원은 중고 AORUS RTX 3090 XTREME WATERFORCE 카드 두 장이다. 하나는 영롱한 청록색, 다른 하나는 빨간색으로 빛난다. 왜 그런지, 어떻게 바꾸는지도 모르겠으니 그냥 이게 공식 컬러 테마인 걸로 하자.
전체 시스템은 Ryzen 7 7840U와 64GB RAM이 박힌 Lenovo ThinkPad 메인보드가 독립 전원으로 돌아간다. 배터리, 화면, 키보드, 케이스 같은 쓸데없는 사치는 다 떼버렸다. 알몸 상태인 메인보드는 커스텀 알루미늄 워터 블록과, 과하다 싶을 정도로 듬뿍 바른 아틱 서멀 구리스, 그리고 업계에서 흔히 클램프라고 부르는 고도의 장착 메커니즘으로 쿨링 중이다.
냉각은 24유로짜리 VW 골프 라디에이터가 담당한다. 대충 호환되는 호스, 피팅, 어댑터들을 영혼까지 끌어모아 연결했다. 루프에 들어가는 냉각수만 2.4리터라 배기량이 2400cc인 셈이다. 현재 신뢰도는 아주 훌륭하다. 너무 뜨거워지지만 않으면 하루에 100ml도 안 샌다.
PCIe 구성도 나름 합리적이다. GPU 하나는 씽크패드의 **WWAN 슬롯(PCIe Gen4 x1)**에, 다른 하나는 **SSD 슬롯(Gen2 x4)**에 꽂았다. 하드웨어 화이트리스트를 날리고, PCIe 파워업 시퀀스를 수정하고, 절전 모드를 끄려고 BIOS까지 패치했다. SSD 슬롯이 이론상으로는 Gen4 x4까지 지원하지만, '이론상'과 '실사용'은 역시 다른 차원의 문제더라.
두 개의 3090은 NVLink로 연결했다. 다행히 인퍼런스가 돌아가기 시작하면 호스트 쪽의 이 괴상한 PCIe 구성은 별로 중요하지 않다.
지금은 우분투를 깔고 vLLM으로 Qwen3.8-27B를 돌리는 중인데, 조용하면서도 속도가 꽤 잘 나온다. 성능 최적화는 아직 진행 중이다.
참고로 3090 없이도 부팅이 가능하다. 그 상태에선 아이들 전력 소모가 낮은 서버가 되는데, 64GB 시스템 RAM과 Vulkan, llama.cpp를 써서 7840U로 작은 모델들을 돌릴 수 있다. 우리 집 헤르메스 봇인 '후트(Hoot)'를 돌리기에 딱이다.
아직 핫스왑은 성공 못 했다.
이게 바로 홈 인퍼런스 공학의 정점이다.


