가난한 자의 이동식 로컬 추론 방법
poor man's way to local inference on the go
핵심 요약
노트북에 eGPU를 연결해 이동 중에도 로컬 LLM을 구동하려는 시도와 그 환경 공유.
- eGPU 환경 — 1360p CPU와 3050 6GB GPU를 활용한 로컬 추론 구성
- llama.cpp 활용 — Qwen3.6 35B 모델 구동 및 내장 웹 UI 테스트
- 이동식 추론 — 노트북과 eGPU 도크를 조합해 외부에서 LLM을 실행함
- 성능 한계 — 벤치마크와 실사용 간의 차이 및 하드웨어 제약 사항 공유
다들 노트북으로 게임하려고 eGPU를 가져오지만, 난 여기서 Qwen3.6 35B A3B를 돌리려고 1회성 구린 하드웨어 설정으로 llama cpp 파라미터를 만지작거리고 있다.
재미있는 건지 아닌지는 모르겠지만, llama 벤치마크 돌리는 건 시간 때우기에 확실히 좋은 방법인 것 같다.
추신: 최근에 추가된 llama cpp 내장 경량 웹 UI가 정말 마음에 든다. 문서에 나와 있듯이 툴 콜(tool call)이 안전하지는 않지만(샌드박싱 없음), 가지고 놀기엔 정말 재밌다.
하드웨어:
-
1360p, 지난 5년간 성능과 발열 면에서 내 철천지원수였던 놈
-
32GB LPDDR5 6400MT
-
AXLE 1슬롯 3050 6GB
-
TH3P4 Lite + 120W DC 어댑터

