4개의 3060ti로 구성한 시스템에서 엄청난 성능을 뽑아내고 있음
Getting stupidly good results on my 4x3060ti setup.
핵심 요약
3060ti 4개를 활용해 텐서 병렬 처리로 27B 모델에서 120 t/s의 놀라운 추론 성능을 달성함.
- 텐서 병렬 처리 — Exl3와 vLLM을 활용해 여러 GPU에서 효율적인 모델 추론을 구현함.
- 가성비 시스템 — 약 600달러의 추가 비용으로 기존 GPU를 재활용하여 고성능 AI 서버를 구축함.
- 성능 최적화 — 27B 모델에서 150k 컨텍스트 윈도우와 120 t/s의 빠른 속도를 확보함.
- 병렬 처리 효율 — 여러 GPU를 활용한 동시 에이전트 실행 시에도 속도 저하가 거의 없음.
한 달 전쯤에 괜히 FOMO 와서 없는 돈 털어 새 그래픽카드 지를 뻔했거든. 근데 그러는 대신 그냥 메인보드랑 CPU 새로 맞추고, 예전에 채굴기 돌리다 굴러다니던 3060ti 4개나 활용해 보기로 했음.
물론 그냥 카드들 다 팔아버릴 수도 있었겠지. 근데 그래봤자 기껏해야 1,000달러나 받으려나? 3090 하나 살 돈도 안 됨.
그래서 4 GPU 채굴기(?) 빌드해서 지난 몇 주 동안 최적화 좀 해봤는데, 꽤 괜찮은 해결책을 찾았다.
핵심은 텐서 병렬(tensor parallel)임. Lllama.cpp는 이걸 지원 안 해서, Turboderp의 훌륭한 작업물인 Exl3를 써보기로 했지. MTP+196k 컨텍스트로 이 모델 돌리니까 대략 70 t/s 정도 나오는데, 아주 잘 돌아감: https://huggingface.co/erlidev/Swift-Qwen3.8-27B-EXL3/tree/SC_4.00bpw_H5_V6
그러다 욕심이 좀 생겨서 더 좋은 게 없나 찾아봤거든. Ampere 카드용으로 나온 HyperQwen 저장소를 발견했는데, 다행히 TP=4를 지원하더라고 https://github.com/syv-ai/HyperQwen
그래서 Vllm으로 새로 세팅하고 나니까 이 모델을 찾게 됨. "syv-ai/qwen38-27b-rtx3090 fast-variant serving shape of ukisai/Swift-Qwen3.8-27b (Qwen3.8-27B의 '추론 간소화' 파인튜닝 버전)인데, 전부 Swift 자체 가중치랑 출력물로만 빌드됨:" https://huggingface.co/liamwh/Swift-Qwen3.8-27B-W4A16-syv-fast
결과는 어떠냐고? bf16 기준으로 150k 컨텍스트 윈도우에서 120 t/s 정도 뽑아줌. kv8로 양자화하면 컨텍스트를 262k까지 꽉 채울 수 있는데, 속도는 Exl3 쓸 때랑 비슷한 70 t/s 정도로 떨어짐.
요약하자면, VRAM 8GB짜리 쪼렙 3060ti 4개에 전력 제한 110w 걸어놓고도, 에이전트 하나를 120 t/s로 미친 듯이 돌리거나, 아니면 큰 컨텍스트 윈도우로 에이전트 2개를 동시에 돌릴 수 있게 됐다는 거임. 아, 그리고 동시 실행해도 속도 저하 거의 없음.
내 TED 강연 들어줘서 고맙다.
