$ ./bin/llama-perplexity -m ~/ggufs/DeepSeek-V4-Flash.gguf -f ../../perplexity/wikitext-2-raw/wiki.test.raw -c 8192 -b 8192 -ub 8192 -cmoe -fit off -fa 1
0.00.474.417 W llama_model_loader: tensor overrides to CPU are used with mmap enabled - consider using --no-mmap for better performance
0.10.392.053 I
0.10.392.174 I system_info: n_threads = 32 (n_threads_batch = 32) / 64 | CUDA : ARCHS = 1200 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | BLACKWELL_NATIVE_FP4 = 1 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | AVX512 = 1 | AVX512_VBMI = 1 | AVX512_VNNI = 1 | AVX512_BF16 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
0.10.392.189 I perplexity: tokenizing the input ..
0.10.924.462 I perplexity: tokenization took 532.264 ms
0.10.924.610 I perplexity: calculating perplexity over 35 chunks, n_ctx=8192, batch_size=8192, n_seq=1
0.22.458.574 I perplexity: 11.53 seconds per pass - ETA 6.72 minutes
[1]2.8897,[2]2.7710,[3]3.1873,[4]3.6052,[5]3.4648,[6]3.5705,[7]3.7952,[8]3.6431,[9]3.5904,[10]3.5542,[11]3.5701,[12]3.6851,[13]3.7128,[14]3.6751,[15]3.7551,[16]3.7644,[17]3.7564,[18]3.8208,[19]3.8337,[20]3.8398,[21]3.8507,[22]3.8847,[23]3.9882,[24]4.0528,[25]3.9720,[26]3.9313,[27]3.9123,[28]3.9423,[29]3.9668,[30]3.9640,[31]3.9817,[32]3.9912,[33]3.9735,[34]4.0053,[35]4.0242,
6.22.639.632 I Final estimate: PPL = 4.0242 +/- 0.02400
Q8_0:
$ ./bin/llama-perplexity -m ~/ggufs/DeepSeek-V4-Flash.gguf -f ../../perplexity/wikitext-2-raw/wiki.test.raw -c 8192 -b 8192 -ub 8192 -cmoe -fit off -fa 1 --cache-type-k q8_0 --cache-type-v q8_0
0.00.485.802 W llama_model_loader: tensor overrides to CPU are used with mmap enabled - consider using --no-mmap for better performance
0.10.435.253 I
0.10.435.377 I system_info: n_threads = 32 (n_threads_batch = 32) / 64 | CUDA : ARCHS = 1200 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | BLACKWELL_NATIVE_FP4 = 1 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | AVX512 = 1 | AVX512_VBMI = 1 | AVX512_VNNI = 1 | AVX512_BF16 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
0.10.435.393 I perplexity: tokenizing the input ..
0.10.961.804 I perplexity: tokenization took 526.402 ms
0.10.961.950 I perplexity: calculating perplexity over 35 chunks, n_ctx=8192, batch_size=8192, n_seq=1
0.22.521.970 I perplexity: 11.56 seconds per pass - ETA 6.73 minutes
[1]2.8842,[2]2.7793,[3]3.1950,[4]3.6124,[5]3.4653,[6]3.5701,[7]3.8000,[8]3.6448,[9]3.5878,[10]3.5534,[11]3.5690,[12]3.6869,[13]3.7161,[14]3.6800,[15]3.7580,[16]3.7656,[17]3.7574,[18]3.8241,[19]3.8383,[20]3.8468,[21]3.8580,[22]3.8934,[23]3.9956,[24]4.0581,[25]3.9765,[26]3.9371,[27]3.9186,[28]3.9494,[29]3.9749,[30]3.9716,[31]3.9896,[32]3.9993,[33]3.9832,[34]4.0122,[35]4.0304,
6.26.279.848 I Final estimate: PPL = 4.0304 +/- 0.02407
Q4_0:
$ ./bin/llama-perplexity -m ~/ggufs/DeepSeek-V4-Flash.gguf -f ../../perplexity/wikitext-2-raw/wiki.test.raw -c 8192 -b 8192 -ub 8192 -cmoe -fit off -fa 1 --cache-type-k q4_0 --cache-type-v q4_0
0.00.435.984 W llama_model_loader: tensor overrides to CPU are used with mmap enabled - consider using --no-mmap for better performance
0.10.360.658 I
0.10.360.777 I system_info: n_threads = 32 (n_threads_batch = 32) / 64 | CUDA : ARCHS = 1200 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | BLACKWELL_NATIVE_FP4 = 1 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | AVX512 = 1 | AVX512_VBMI = 1 | AVX512_VNNI = 1 | AVX512_BF16 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
0.10.360.794 I perplexity: tokenizing the input ..
0.10.886.143 I perplexity: tokenization took 525.34 ms
0.10.886.291 I perplexity: calculating perplexity over 35 chunks, n_ctx=8192, batch_size=8192, n_seq=1
0.22.520.679 I perplexity: 11.63 seconds per pass - ETA 6.78 minutes
[1]3.0059,[2]2.8369,[3]3.2596,[4]3.6650,[5]3.5126,[6]3.6189,[7]3.8468,[8]3.6861,[9]3.6260,[10]3.5867,[11]3.5995,[12]3.7178,[13]3.7424,[14]3.7061,[15]3.7874,[16]3.7935,[17]3.7830,[18]3.8481,[19]3.8604,[20]3.8667,[21]3.8754,[22]3.9084,[23]4.0125,[24]4.0766,[25]3.9975,[26]3.9580,[27]3.9393,[28]3.9692,[29]3.9949,[30]3.9923,[31]4.0101,[32]4.0198,[33]4.0038,[34]4.0337,[35]4.0512,
6.28.034.177 I Final estimate: PPL = 4.0512 +/- 0.02420
주요 댓글
r/localllama
사용자들은 DeepSeek V4의 KV 캐시 양자화 성능에 대해 긍정적인 반응을 보이며, 실제 구동 환경과 설정에 대한 정보를 활발히 공유하고 있습니다.
4
좋네요! 8개의 GPU에서 fp16 k/v로 돌려보니 초당 33토큰 나오네요. 10만 컨텍스트로 돌렸습니다. 3090 4개랑 3080 4개 썼어요.
100만 컨텍스트로 늘려도 잘 돌아가네요. 8k 정도 되는 큰 프롬프트를 던져봤는데 pp는 420 정도 나왔고, tg는 꽤 안정적입니다. 이전 프롬프트들로 테스트해보니 결과가 아주 훌륭하네요. 빨리 메인라인에 들어갔으면 좋겠습니다. antirez가 MTP를 올린 걸 봤는데, 이거 MTP 지원하나요? 그리고 pro quant도 있던데 그것도 작동할지 궁금하네요.
2
MTP는 아직 지원 안 합니다. Pro는 잘 작동할 거예요.
-1
솔직히 말해서, 8개의 괜찮은 GPU를 쓰고도 그 속도라니 좀 아쉽네요.
1
KV 캐시 양자화랑은 딱히 상관없을 수도 있는데, ds v4 flash에서 도구 호출(tool calling) 기능이 작동하나요? bartowski가 올린 gguf를 opencode랑 같이 써봤는데 파일을 생성하려고 하질 않더라고요. (공식 llama cpp)
1
장기 작업용으로 훈련된 모델이라 도구 호출을 지원합니다. 문제가 있다면 에이전트 하네스(agent harness) 쪽 문제일 가능성이 높아요.
1
0
ROCm은 언제 되나요? <3
4
죄송합니다, ROCm은 경험이 전혀 없어서요. 제가 마지막으로 썼던 AMD GPU는 암호화폐 열풍 때 썼던 Radeon R9 290 4개가 전부였네요.
1
0
작성자님, RTX 6000에서 여유 메모리가 얼마나 남나요? 저는 3090 4개 쓰고 있어서 오버헤드가 좀 있을 것 같거든요. 다운로드 중입니다....
0
100만 컨텍스트 벤치마크(q8_0 KV 캐시) 돌릴 때 GPU 메모리 사용량은 95622MiB / 97887MiB 정도예요. 이건 ubatch를 2048로 설정했을 때 기준이고, 1024로 낮추거나 컨텍스트를 줄이거나 q4_0 KV 캐시를 쓰면 메모리는 더 확보할 수 있습니다.
0
0
저는 아직 IK 기다리는 중입니다. 언젠간 나오겠죠. GLM 속도 개선 작업 끝나면 다룰 거라고 하더라고요.
방금 DeepSeek-V4-Flash로 Pi 에이전트 돌려서 hello world 앱 만들어봤는데 도구 호출 잘 되던데요. 저는 llama-server를 --chat-template-file models/templates/deepseek-ai-DeepSeek-V4.jinja 옵션 주고 실행했어요.
Bartowski GGUF에 템플릿이 이미 포함되어 있는지는 모르겠는데, 이 파라미터를 추가해봐야 할 수도 있어요.