본문으로 건너뛰기 핵심 요약
RTX 6000 PRO를 활용해 VRAM 용량별 Qwen3.8-Flash-Next의 성능을 벤치마크한 결과, VRAM 용량과 컨텍스트 길이에 따른 성능 변화를 분석함.
- 성능 벤치마크 — CPU 전용 8.34 tok/s에서 96GB VRAM 사용 시 109.07 tok/s까지 속도 향상됨
- 컨텍스트 영향 — 컨텍스트가 길어질수록 VRAM 용량에 따른 성능 격차가 2.80배에서 1.45배로 감소함
- 메모리 최적화 — RAM 상주 로딩 방식이 mmap 대비 1.87배 빠른 프리필 성능을 보임
- 아키텍처 효율성 — MoE 설계 덕분에 CPU만으로도 8.34 tok/s의 실용적인 추론 속도를 확보함
| Usable VRAM | Expert layers in RAM | Prefill | Decode |
|---|
| 8GB | 48 of 48 | 232 tok/s | 35.69 tok/s |
| 16GB | 45 of 48 | 249 tok/s | 37.93 tok/s |
| 24GB | 42 of 48 | 260 tok/s | 39.01 tok/s |
| 32GB | 36 of 48 | 292 tok/s | 42.24 tok/s |
| 48GB | 23 of 48 | 746.7 tok/s | 51.73 tok/s |
| 96GB | 0 of 48 | 1,955 tok/s | 109.07 tok/s |
모든 GPU 테스트는 동일한 RTX PRO 6000을 사용함. 제한을 건 건 메모리 용량 테스트용이지, 저사양 GPU 성능 테스트가 아님.
1. CPU에서 모델 구동
2K 프롬프트에서 CPU 단독으로 프리필 182.64 tok/s, 디코딩 8.34 tok/s 나옴.
MoE 구조라 토큰당 6B 파라미터만 활성화되는 게 한몫함.
2. 긴 컨텍스트에서 VRAM 등급 간 격차 감소
2K 프롬프트에선 96GB가 24GB보다 2.796배 빨랐다.
근데 245K 프롬프트에선 그 격차가 1.451배로 줄어듦.
245,760 토큰 프롬프트에서의 디코딩 속도:
-
24GB: 14.89 tok/s
-
32GB: 15.41 tok/s
-
48GB: 16.96 tok/s
-
96GB: 21.61 tok/s
컨텍스트 길어지면 모든 설정에서 속도 저하 발생함. 원래 제일 빨랐던 놈이 성능 하락폭도 제일 큼.
48개 레이어 중 12개만 어텐션 캐시가 늘어나는 구조고, 나머지 36개는 Gated DeltaNet을 씀.
덕분에 컨텍스트 메모리는 비교적 적게 먹지만, 긴 컨텍스트 디코딩이 공짜인 건 아님.
3. 이번 빌드에서 CUDA 상의 PLE는 55.6배 느렸음
GGUF 파일 안에 레이어당 27.2 GiB짜리 토큰 임베딩 테이블이 들어있음.
-
시스템 RAM: 프리필 1,967.9 tok/s, 디코딩 108.5 tok/s
-
GPU VRAM: 프리필 575.7 tok/s, 디코딩 1.95 tok/s
CUDA에 올렸을 때 디코딩 속도가 55.6배 더 느렸음.
텐서가 이동한 건 확인했는데, 속도가 왜 느려지는지 원인까지는 못 찾았다.
A-B-B-A 순서로 테스트를 반복해 봤는데, 순서에 따른 오차는 0.56% 정도였음.
메모리 데이터로도 배치가 제대로 된 걸 확인했다. 테이블을 CUDA로 옮기니까 GPU 사용량이 대략 27.5 GiB 늘어나더라.
CPU에 배치했을 때는 디코드 토큰당 대략 9.2 ms가 걸림.
CUDA에 배치했을 때는 디코드 토큰당 대략 513 ms가 걸림.
이건 단순히 연산만으로 설명하기엔 지연 시간이 너무 길다. 동기화 문제나 토큰별 전송 문제 같은데, 정확한 원인은 아직 증명 못 함.
per_layer_token_embd=CUDA0 설정하니까 llama.cpp b10666 버전에서 디코드 속도가 108.5에서 1.95 tok/s로 떡락함.
4. RAM 상주 로딩으로 프리필(prefill) 성능 1.87배 향상
48GB 텐서 배치 상태에서 mmap이랑 RAM 상주 로딩을 비교해 봤다.
디코드 비율은 0.998이라서 사실상 차이가 없었음.
이게 파일 매핑을 안 쓴다는 뜻이지, 모델을 안 불러온다는 소리는 아님.
이 모드를 쓰려면 시스템 RAM이 충분히 비어 있어야 함.
5. KV 레이아웃 변경이 동시성(concurrency)에 미치는 영향
요청 1개부터 16개까지, 통합(unified) KV 레이아웃이랑 비통합(non-unified) KV 레이아웃을 각각 테스트해 봤다.
둘 다 요청 1개일 때는 59.0 tok/s로 시작함.
-
통합 KV: 68.8 tok/s
-
비통합 KV: 92.0 tok/s
동시성이 높을 때는 비통합 KV가 전체 출력량이 더 많았다.
물론 개별 요청 속도는 여전히 느려짐. 동시성을 높이면 서버 전체 처리량은 늘어나지만, 요청 하나하나가 빨라지는 건 아님.
비통합 KV는 가용 컨텍스트를 슬롯별로 쪼개기 때문에 항상 정답인 설정은 아님.
일단 제외한 결과들
최종 수치는 내 저장소랑 영상에 다 올려놨음.
리소스
보고서, 스크립트, 설정, 결과, 그래프가 담긴 GitHub:
내 주된 질문은 PLE CUDA 결과에 관한 거임.
혹시 다른 GPU나 더 최신 llama.cpp 빌드에서 per_layer_token_embd=CUDA0 썼을 때 똑같이 속도 저하 겪은 사람 있음?
다른 질문은 대화에서 이전 사고 과정을 유지하는 거에 대한 거임.
똑같은 5턴짜리 코딩 대화를 돌려봤는데, 이전 추론 내용을 나중 프롬프트에 남겨둘 때랑 지울 때를 비교해 봤거든.
내용을 남겨두니까 기록이 계속 뒤에 붙는 방식이라 프롬프트 재계산 토큰 수가 18,403개에서 267개로 줄어들었음. 근데 5턴째 프롬프트가 18,387개에서 63,223개 토큰으로 늘어나면서, 디코드 속도가 65.5 tok/s에서 48.9 tok/s로 떨어지더라.
이건 temperature 1.0으로 각 경우당 딱 한 번씩만 돌린 거임. 시작 속도부터 110.2 tok/s랑 96.0 tok/s로 달랐어서, 69배니 25%니 하는 수치를 완전히 신뢰하긴 좀 그럼.
이런 트레이드오프 겪어본 사람 있음? 원래 이전 추론 내용을 남겨두는 게 프롬프트 재계산을 이 정도로 줄여주는 건지, 그리고 긴 프롬프트가 디코드 속도를 어느 정도나 깎아먹는 게 정상인지 궁금함.
아니면 이 모델 효율 더 뽑아낼 수 있는 다른 팁 있으면 공유 좀.
주요 댓글
r/localllama사용자는 TG 스케일링의 선형성에 감탄하면서도, 고성능 GPU인 Pro6000의 프리필 속도가 예상보다 낮다는 점에 의문을 제기함.
9그냥 4x 48GB 4090 vLLM에서 돌린 3.8 Flash 수치 여기 던져놓고 감. 아마 다시는 안 올 듯.
run pp_tok/s tg_tok/s e2e_tok/s TTFT_s
2 7580.4 130.4 63.7 2.057
3 7598.3 126.5 62.8 2.052
4 7603.0 136.6 65.2 2.051
avg 7593.9 131.1 63.9 2.053
13090 4개 300W 세팅에서 거의 비슷한 e2e 결과 나옴
48GB에서 35t/s 나온다는 건 말도 안 됨. 난 8t/s밖에 안 나오는데.
11
제한 사항은 메모리 용량을 시뮬레이션한 것이지, 더 작은 GPU의 성능을 시뮬레이션한 게 아님.
아마 당신의 GPU 메모리 대역폭이 Pro6000보다 4배 느린가 보네요.
2맞아, 깃 익스텐션으로 올리다가 실수로 클릭을 잘못했나 봐. 이제 다 공개됐을 거야, 미안.
그렇다면 작성자가 하는 것처럼 4060과 비교하는 건 무리겠네요.
3이거 충분히 믿을만하다고 봄. 나도 2019년식 워크스테이션(스레드리퍼 3955wx, ecc ddr4 100gb 이상)에 8gb Quadro RTX 4000(대역폭 416gb/s 개쩜) 꽂아서 Q2_K_XL 돌리는데 20 t/s 정도 나옴.
1흥미롭네. 난 스레드리퍼가 없어서, 그게 카드 대역폭을 보완해 주는 것 같아.
1그러니까 지금 나보고 쿼드로 RTX 4000에 200 태우라는 거지? 당장 간다.
13090 + Ryzen 7700 / 96GB 환경에서 -cmoe(VRAM 약 5-7GB 사용) 적용 시 생성 속도 20 t/s부터 시작함. UD-Q4_K_XL 모델 사용. 싱글 CCD Ryzen이라 RAM 대역폭이 약 64GB/s 정도밖에 안 됨.
0나도 rtx 4050 (6gb ram)에서 qwen 3.6 35B 돌리니까 35t/s 나오더라
고마워, 난 사람들이 올린 깃허브랑 벤치마크 읽는 거 좋아하거든 :)
미국 기업들이 비용 절감과 데이터 보안을 이유로 비싼 프론티어 AI 모델 대신 오픈 소스 모델로 눈을 돌리고 있음.
미국 기업들이 비용 절감과 데이터 보안을 이유로 비싼 프론티어 AI 모델 대신 오픈 소스 모델로 눈을 돌리고 있음.
사이버 보안 전문가가 Claude를 활용해 며칠 걸리던 고난도 CTF 문제를 단 2시간 만에 해결한 경험담.
사이버 보안 전문가가 Claude를 활용해 며칠 걸리던 고난도 CTF 문제를 단 2시간 만에 해결한 경험담.
AI 에이전트들이 담배를 피우며 여유를 부리는 영상에 대한 유머러스한 반응과 원작에 대한 고찰이 이어짐.
AI 에이전트들이 담배를 피우며 여유를 부리는 영상에 대한 유머러스한 반응과 원작에 대한 고찰이 이어짐.