RPC로 300GB 모델 로드할 때 5분이나 걸리는 게 지겨워서 PR 26291로 300% 속도 향상시켜 1분 30초로 단축함 (4060ti+ddr4) + (4060ti+ddr5)
I got tired of my 300GB model loads taking 5min on RPC. PR 26291 speeds it 300% to 1min30sec (4060ti+ddr4) + (4060ti+ddr5)
핵심 요약
llama.cpp의 RPC 모델 로딩 속도를 300% 개선한 PR을 공유하며, 저사양 환경에서도 효율적인 모델 구동을 목표로 함.
- RPC 로딩 최적화 — GGML_RPC_LOAD_THREADS 변수를 도입하여 300GB 모델 로딩 시간을 5분에서 1분 30초로 단축함.
- 하드웨어 구성 — 4060ti와 DDR4/DDR5 조합의 저사양 환경에서 테스트를 진행함.
- 오픈소스 기여 — PR 26291을 통해 커뮤니티의 RPC 성능 개선을 도모함.
- 소버린 AI 지향 — 고가의 장비 없이도 여러 대의 게이밍 PC로 AI를 구동하려는 사용자들을 위해 개발함.
- b10173 버전 - "state":"loading" 4분 54초.
- 이 PR과 GGML_RPC_LOAD_THREADS 12 적용 시 - "state":"loading" 1분 38초
PR은 거의 준비되었고, 새로운 GGML_RPC_LOAD_THREADS 변수를 유지하려면 문서 수정이 필요함. 클라이언트 측 문제는 해결되었으니 서버 측 작업도 누군가 이어받아 1분 미만으로 로딩 시간을 줄일 수 있으면 좋겠음.
이 코드를 감자 같은 저사양 하드웨어에서 개발했다는 점이 좀 웃김. 테스트해 주는 사람은 아마 내 전체 장비 값만큼을 시간당 비용으로 내고 있을 텐데.
하지만 '소버린 AI 전쟁' 속에서 나는 게이밍 PC 2~3대로 돌리는 사람들을 위해 코딩함.

