Intel N100과 RTX 5060 Ti를 사용한 괴상하고 저전력인 llama.cpp 서버를 구축했습니다
I built a weird, low-power llama.cpp server using an Intel N100 + RTX 5060Ti
핵심 요약
Intel N100 보드와 RTX 5060 Ti를 활용해 저전력으로 24시간 가동되는 고성능 LLM 서버를 구축한 사례입니다.
- 하드웨어 구성 — Intel N100 메인보드와 RTX 5060 Ti를 PCIe 라이저 케이블로 연결하여 구축함
- 성능 최적화 — llama.cpp를 통해 Qwen 3.6 27B 모델을 40 t/s 속도로 구동하며 65k 컨텍스트를 활용함
- 전력 효율 — 유휴 상태 40W, 고부하 시 200W 미만의 낮은 전력 소모를 달성함
- 실사용 환경 — OpenCode와 연동하여 코딩 및 문서 작업용으로 24시간 API 서버를 운영함
내 오래된 ASRock J1900이 갑자기 뒤지면서 모든 게 시작됐다. 완벽한 ITX 대체품을 찾다가 중국산 CW-NAS-ADLN-K 메인보드를 발견했는데, 스펙상으론 완벽해 보였음. Intel N100, DDR5, SATA 6개, NVMe 2개. 성능이 좀 더 좋아지니까 Docker로 이것저것 실험도 해보고 셀프 호스팅 서비스도 본격적으로 돌리기 시작했지.
이 서버에서 내 AI 여정은 Immich의 머신러닝 작업부터 시작됐는데, iGPU가 OpenVINO 써서 내 미디어 라이브러리 전체를 아주 깔끔하게 처리하더라.
그와 동시에 LLM은 GTX 1070(8GB) 달린 MSI GS65 노트북으로 처음 접해봤음. 다들 그렇겠지만, 지금은 구닥다리가 된 Llama 3 처음 돌렸을 때 그 마법 같은 기분은 잊을 수가 없다. 솔직히 실무에 쓰기엔 좀 애매했지만 말이야. 그때부터 새로 나오는 모델은 죄다 테스트해봤고, 지금은 Qwen 3.5랑 Gemma 4를 아예 일상 업무에 녹여서 쓰고 있음.
그러다 보니 "한 단계 더 나아가야겠다"는 생각이 들더라. 추론 시간은 점점 길어지고 횟수도 잦아지는데, 내 메인 노트북 GPU를 90도까지 굴리면서 고장 낼까 봐 불안해서 못 쓰겠더라고. 그래서 고민이 시작됐지. 나한테 맞는 GPU가 뭘까? 처음엔 중고 RTX 3060 12GB를 알아봤는데, 12GB VRAM으로는 쓸만한 모델 돌리기엔 딱 간당간당할 것 같더라고.
그러다 우연히 평소 가던 하드웨어 쇼핑몰에서 리퍼비시 ASUS RTX 5060 Ti가 450유로에 올라온 걸 보고, 고민도 안 하고 바로 질러버렸다.
설치하려고 보니까 N100의 처리 능력이나 PCIe 3.0 x4 병목 현상이 발목 잡지 않을까 걱정되긴 했는데, 정작 문제는 물리적인 거였음. 그래픽카드가 SATA 포트랑 메인 ATX 커넥터에 걸리는 거임. 진짜 멍청한 짓 했다 싶더라. 근데 머리 좀 굴려보니까 금방 해결책이 나오더라고. PCIe 라이저 케이블 써서 GPU를 케이스 밖으로 빼버리면 되는 거였음.
