예산형 하드웨어에 대해 물어볼 때 최신 AI 모델을 믿지 마세요!
Don't trust frontier models when asking about budget hardware!
핵심 요약
최신 AI 모델은 하드웨어 가성비 판단에 부정확하므로, 직접 정보를 찾아보고 실험하는 것이 훨씬 효과적입니다.
- P100 가성비 — 100달러 미만으로 로컬 AI 추론을 시작할 수 있는 저평가된 카드임
- AI 모델의 한계 — 최신 모델은 실시간 시장 가격이나 하드웨어 정보를 정확히 반영하지 못함
- 직접적인 실험 — llama.cpp 패치와 쿨링 솔루션을 통해 구형 서버 카드도 충분히 활용 가능함
- 정보 수집 방식 — 모델에게 판단을 맡기기보다 하드웨어 사양과 기준을 물어보고 직접 비교하는 것이 좋음
올해 초에 처음 추론 환경 구축하려고 알아볼 때만 해도 16GB Tesla P100을 60~80달러면 살 수 있었거든. Claude한테 물어보니까 절대 사지 말라더라. 텐서 코어도 없고, int4/int8 성능 구리고, BF16 지원 안 해서 돈 낭비라고. 전원 연결도 까다롭고, 바이오스에서 Above 4G decoding 옵션 켜야 하는데(마치 엄청 희귀한 옵션인 것처럼 말하더라), 쿨링도 따로 챙겨야 한다고 겁을 주더라고.
그래서 그냥 RX6600XT를 llama.cpp에서 미친 듯이 최적화해서 썼지. 나름 꽤 괜찮게 뽑아냈어.
근데 그냥 에라 모르겠다 싶어서 지난주에 P100 하나 질렀고, 그저께 도착했다. 적절한 커넥터 달린 파워 서플라이도 새로 샀어(어렵지도 않고 비싸지도 않음. 괜찮은 브랜드 제품도 60달러면 사고, 난 여유 있게 쓰려고 100달러짜리 샀음). 성능 격차 메꾸려고 온갖 최적화 다 때려 박은 llama.cpp 포크랑 패치들도 준비하고, 녹투아 94mm 팬 달려고 3D 프린터로 하우징도 뽑았지. 프리필 단계에선 정압이 좀 부족해서 열이 좀 나는데, 생성 단계에선 차고 넘치더라.
기존에 RX6600 XT로 Qwen3.6 35B A3B UD_Q4_K_XL 모델 돌릴 때 MTP랑 --cpu-moe 써서 나온 수치가 이거였어:
PP는 0 컨텍스트에서 800 정도, 10k 넘어가면 700 정도로 떨어짐.
TG는 일반 문장 30~35, 코드 45~50 정도.
이 세팅으로 16bit kv에서 64k 컨텍스트(어쩌면 더 높게도) 돌릴 수 있었어. cpu-moe가 이 부분에서 진짜 도움 많이 되더라.
근데 shinbunbun의 llama.cpp 패치 써서 살짝 튜닝하고, 같은 모델에 같은 MTP 설정, --n-cpu-moe 22로 돌리니까 결과가 이렇게 나옴:
PP는 0 컨텍스트에서 600 정도, 10k 넘어가면 440~500 정도.
TG는 일반 문장 54~60, 코드 66~72 정도.
지금은 일단 32k 컨텍스트로 돌리는 중이야. n-cpu-moe 더 높이면 더 넣을 수도 있겠지만, 내 작업 환경에선 30k 이상 쓸 일이 거의 없어서 이 정도면 충분해.
Qwen 3.6 35B랑 3.X 27B 모델들 사이의 성능 차이가 꽤 크다는 건 알지만, 이 가격에 이 정도 성능이면 진짜 미친 거지. 내가 살 때보다 가격이 15달러 정도 올랐는데, 그래도 100달러 미만으로 이 정도 추론 성능 뽑아내는 건 다른 방법으론 절대 불가능해.
하나 더 오고 있으니까 나중엔 모델 전체를 오프로드하고 3.8 27b도 돌려볼 생각이야. 지금 IQ3_K_XL로 MTP 쓰면 초당 9토큰 정도 나오는데 컨텍스트는 거의 못 쓰는 수준이거든. 카드 한 장에 들어가는 모델을 여러 장에 나눠서 돌리면 속도가 빨라지는지는 잘 모르겠어. 완전 처음 해보는 거라 좀 설레네.
이 카드 진짜 저평가됐어. 로컬 AI 입문하려는 사람들한테 이만한 가성비 장비가 없다. 예전엔 모델 돌리는 동안엔 컴퓨터 건드리지도 못하고 맥북으로 딴짓해야 했는데(게임은 꿈도 못 꿨지), 이제는 PC로 뭘 하든 백그라운드에서 모델 돌려놓고 맘 편하게 작업할 수 있어. 두 번째 카드 오면 둘 다 박아 넣을 전용 추론 머신 만들 계획이야. VW 라디에이터로 PC 쿨링하던 그 형님 보고 영감 좀 받았다.
