다중 모델 백엔드로는 무엇을 쓰시나요? 설정 변경은 어떻게 하시나요?
What are people using for multi-model backends? What about swapping configs?
핵심 요약
다중 GPU 환경에서 모델 구성을 유연하게 전환하고 관리하기 위한 최적의 백엔드 솔루션을 찾는 질문입니다.
- 다중 GPU 구성 — 4개의 3090 GPU를 활용한 유연한 모델 배포 환경 구축함
- 모델 전환 최적화 — 모델 설정 변경 시 발생하는 수동 작업과 복잡성을 최소화하려 함
- 백엔드 솔루션 — LiteLLM, Llama-swap 등 다양한 도구의 장단점을 비교 분석함
- 운영 모드 관리 — 작업 성격에 따라 모델 모드를 전환하는 효율적인 워크플로우를 모색함
코딩 모델이나 Hermes 같은 거 돌릴 서버 하나 구축하려고 계획 중이야. GPU 여러 개 박아놓고 상황에 따라 유연하게 쓰고 싶거든. 예를 들면 Hermes 쓰면서 가벼운 코딩할 땐 작은 모델 두 개 돌리고, 코딩 안 하고 Hermes만 쓸 땐 GPU 여러 개 묶어서 큰 모델 하나 돌리고, 아니면 코딩이랑 툴 콜 성능 빡세게 챙겨야 할 땐 더 큰 모델 하나로 갈아타는 식으로 말이야. 로컬 모델 성능 최적화하려고 진짜 끝도 없이 파고들었거든(club-3090 깃허브 레포 진짜 대박이더라, 내 자만심을 제대로 꺾어줌!). 근데 모델 구성 바꿀 때마다 뜯어고치고 다시 세팅하는 게 내가 본 모든 솔루션의 고질적인 문제더라고. 특히 새 모델(Omni 같은 거!) 써보고 싶거나 세팅 좀 만질 때 수동으로 개입하는 걸 최소화하고 싶어.
llamaswap, LiteLLM, llamactl 다 장단점이 있더라고. GPUStack 같이 괜찮아 보이는 덜 알려진 옵션들도 있는데, 이것도 기업용 느낌이 너무 강해서 문제가 좀 있고.
결국엔 그냥 적당히 타협하고 성능이랑 유연함은 양립할 수 없다는 걸 받아들여야 하나 싶기도 해. 뭘 하든 세팅하고 배포하는 데 시간 쏟는 건 피할 수 없겠지... 그래도 나보다 좋은 장비 쓰는 형들이 이미 다 겪어봤을 테니까, 커뮤니티에서 이미 다 알아낸 거 굳이 시간 낭비하며 다시 배울 필요 없이 물어보는 게 낫겠다 싶어서 글 써봐.
형들은 뭐 쓰고 있어? 아니면 좀 파볼 만한 거 뭐 없을까? 미리 고맙다, 레딧 형들!
아, 참고로 내 장비는 Threadripper 3945WX에 3090 4장 박아놨어. 내가 생각하는 조합은 위에서 말한 대로야. 큰 코딩 모델, 큰 범용 모델, 아니면 범용 모델이랑 섞어서 쓰는 거(예를 들면 Hermes용으로 최소 카드 한 장에 Gemma 4나 Qwen3.6 MoE 올리는 식). 새 모델 쓸 때 최대한 독립적으로 돌아가게 해서 Hermes가 알아서 오케스트레이션하게 만들고 싶고, 특수 툴(3090-club 패치된 vLLM 레시피 같은 거)은 최대한 격리해두려고 해. 수정: 램은 예전 시스템에서 긁어모은 DDR4-2400 128GB 정도 박을 예정이야.
