DGX Spark 한 대에서 124B 모델을 일주일간 벤치마킹하고 전체 공개함 — 가장 빠른 경로에서 38.7 tok/s 달성, 같은 장비에서 DeepSeek V4 Flash 대비 2.4배 성능
Benched a 124B on one DGX Spark for a week and published all of it — 38.7 tok/s on the fastest path he found, 2.4x DeepSeek V4 Flash on the same box
핵심 요약
Ling-3.0-flash 모델의 벤치마크 결과를 공유했으나, 비교 대상의 적절성과 광고성 문구에 대해 커뮤니티의 강한 비판이 제기됨.
- 벤치마크 결과 — DGX Spark에서 38.7 tok/s 기록함
- 성능 비교 — DeepSeek V4 Flash 대비 2.4배 빠르다고 주장함
- 데이터 신뢰성 — 구형 벤치마크를 사용했다는 비판을 받음
- 커뮤니티 반응 — 광고성 문구와 AI로 작성된 듯한 글에 거부감을 보임
sudoingX on X가 일주일 동안 이 작업에 매달려 정리한 내용을 올렸습니다. 하드웨어는 본인 소유입니다. 그는 우리와 아무런 관계가 없으며, 그가 공개하기 전까지 우리는 그 내용을 전혀 보지 못했습니다. 저는 inclusionAI에서 Ling을 작업하고 있습니다.
그가 Spark 한 대에서 도달한 결과는 다음과 같습니다: 제대로 설정했을 때 공식 INT4에서 38.7 tok/s, 커뮤니티 GGUF에서 35.2 tok/s를 기록했으며, 이는 같은 장비에서 DeepSeek V4 Flash가 내는 성능의 2.4배입니다. 그의 표현을 빌리자면 Ling-3.0-flash는 그의 장비에서 영구적인 자리를 차지하게 되었습니다.
제 눈길을 끈 것은 중간에 수정된 내용이었습니다. 그는 처음에 우리 공식 양자화 모델이 Spark 한 대에서는 돌아가지 않는다고 올렸었습니다. 이틀 뒤 그는 그 모델들이 돌아간다는 내용과 함께, 그것이 현재 자신이 찾은 가장 빠른 경로라는 글을 올리며 자신의 이전 게시물을 인용했습니다.
그 수치들의 대부분은 그의 타임라인에 방법론과 함께 나와 있으니, 제 말만 믿을 필요는 없습니다.
Spark 한 대와 한 사람, 일주일간의 기록입니다. 그는 제가 이 주제에 대해 읽어온 시간보다 더 오래 이 일을 해왔습니다.


