참고: 요즘 llama.cpp 서버는 30초 안에 모델 핫스왑이 가능함
FYI llamacpp server can hot swap models now-a-days in under 30sec
핵심 요약
llama.cpp 서버의 모델 핫스왑 기능이 비약적으로 빨라져 30초 이내에 전환이 가능해졌습니다.
- 모델 핫스왑 — llama.cpp 서버에서 모델 전환 속도가 매우 빨라짐
- 호환성 — OpenWebUI 및 Hermes와 원활하게 연동됨
- 성능 향상 — 과거 PyTorch 기반 로딩보다 훨씬 효율적인 전환 속도 제공
새로운 글이나 댓글을 볼 때마다 이 질문을 최소 몇 번은 보는데, 이제 llama.cpp는 OpenWebUI 및 Hermes와 바로 연동되는 깔끔한 모델 핫스왑 API를 갖추고 있어.
보너스: 영상 녹화 중에 두 번째 모델인 gemma가 맛이 가버렸지만, 스왑에 걸리는 시간은 말도 안 되게 빨라졌어... 불과 몇 달 전만 해도 로딩 시작해 놓고 PyTorch가 작업하는 동안 산책 다녀오곤 했던 게 기억나네.


