Volta를 다시 빠르게 만들자
Make Volta Fast Again
핵심 요약
10년 된 V100 GPU에서 LLM 추론 성능을 극대화하기 위한 1Cat-vLLM 포크 활용법과 벤치마크 결과를 공유합니다.
- V100 최적화 — 10년 된 V100 GPU에서 LLM 추론 성능을 극대화하는 1Cat-vLLM 포크 소개
- 벤치마크 비교 — Strix Halo와 V100 간의 Qwen3.6-35b 모델 추론 성능 수치 공개
- 하드웨어 튜닝 — vLLM 사용 시 flash attention, triton 등 하드웨어 맞춤형 설정의 중요성 강조
- 커뮤니티 피드백 — V100 사용자들 간의 최적화 설정 공유 및 성능 개선 경험담 교류
V100 카드 쓰는 형들을 위해 1Cat-vLLM 하나 소개해줌. 이거 vLLM 포크 버전인데 V100에서 서빙 최적화 쌉가능함. Qwen3.6-35b 모델로 Strix Halo에서 개조진 llama.cpp 포크(pwilkin) 돌린 거랑, V100에서 1Cat 돌린 거 성능 비교한 수치임. 완벽한 1:1 비교는 아니지만, 대충 성능 감이라도 잡으라고 llama-benchy에서 나온 날것 그대로의 수치 가져왔음. 내 생각엔 10년 된 GPU 치고는 여전히 훌륭하다고 봄.
더 좋은 최적화 방법 있으면 댓글로 좀 알려주라!
