Lemonade에 vLLM ROCm이 실험적 백엔드로 추가됨
vLLM ROCm has been added to Lemonade as an experimental backend
핵심 요약
Lemonade가 vLLM ROCm 백엔드를 실험적으로 지원하여 GGUF 변환 없이도 LLM을 바로 실행할 수 있게 되었습니다.
- vLLM 지원 — GGUF 변환 과정 없이 .safetensors 모델을 바로 실행할 수 있게 됨.
- 실험적 백엔드 — 필수 기능은 구현되었으나 일부 미흡한 부분이 있어 커뮤니티 피드백을 수집 중임.
- llama.cpp 비교 — vLLM은 데이터센터와 고성능에 강점이 있고, llama.cpp는 범용성과 하드웨어 호환성에 강점이 있음.
- AMD 지원 강화 — AMD PC 팀이 커뮤니티 피드백을 수용하여 하드웨어 지원 확대를 위해 노력 중임.
vLLM은 GGUF로 변환하기 전의 .safetensors LLM을 실행할 수 있는 능력이 있으며, 탐색해 볼 만한 새로운 엔진을 제시합니다. 저는 개인적으로 u/krishna2910-amd/ u/mikkoph 그리고 u/sa1sr1이 Lemonade에서 llama.cpp를 실행하는 것만큼 쉽게 만들기 전까지는 사용해 본 적이 없었습니다:
lemonade backends install vllm:rocm
lemonade run Qwen3.5-0.8B-vLLM
이것은 필수적인 기능들은 구현되었지만, 아직 알려진 거친 부분들이 있다는 점에서 저희에게는 실험적인 백엔드입니다. 저희는 커뮤니티의 피드백을 통해 이 기능을 어디까지, 어떻게 발전시켜야 할지 확인하고 싶습니다. 흥미로우시다면 여러분의 생각을 알려주세요!
빠른 시작 가이드: https://lemonade-server.ai/news/vllm-rocm.html
GitHub: https://github.com/lemonade-sdk/lemonade
Discord: https://discord.gg/5xXzkMu8Zk


