듀얼 3060 및 96GB RAM 환경에서 DeepSeek V4 Flash 0731 IQ2_M 벤치마크 (약 3.5 tok/s)
DeepSeek V4 Flash 0731 IQ2_M benchmark for Dual 3060 and 96GB RAM ≈ 3.5 tok/s.
핵심 요약
듀얼 RTX 3060과 96GB RAM을 활용해 DeepSeek V4 Flash 모델을 구동한 벤치마크 결과입니다.
- 성능 측정 — 듀얼 3060 환경에서 약 4.5 tok/s 속도 기록
- 설정 환경 — Windows 11 및 Unsloth Studio 사용
- 하드웨어 구성 — Ryzen 7500F CPU와 96GB RAM 조합
- 최적화 논의 — cmoe 옵션 및 배치 설정에 따른 성능 차이 공유
[블록 1/8] 커뮤니티의 도움 덕분에 드디어 이 LLM을 실행했습니다. LM Studio에서는 두 번째 GPU에 가중치를 로드하는 걸 거부해서 Unsloth Studio를 사용해 모든 작업을 마쳤습니다. 제대로 된 벤치마크는 아니지만(PC로 병렬 작업도 같이 돌렸음), RAM 오프로딩을 사용한 듀얼 3060의 성능이 어느 정도인지 감을 잡을 수 있을 겁니다.
[블록 2/8] Unsloth를 사용한 DeepSeek V4 Flash 0731 IQ2_M
[블록 3/8] CPU: Ryzen 7500F
GPU 0 (PCIe 5.0x16 레인): RTX3060
GPU 1 (PCIe 3.0x1 레인): RTX3060
RAM: 96GB 5600
[블록 4/8] 프롬프트: 테트리스 게임 하나 짜줘.
[블록 5/8] 결과 (요약본에서 복사):
프롬프트 평가: 2.96s
프롬프트 속도: 3.0 tok/s
생성: 960.02s
속도: 4.5 tok/s (PowerShell에서는 3.5 tok/s로 나오는데 왜 4.5 tok/s로 나오는지 모르겠네요. RAM 오프로딩을 쓴 단일 GPU 출력은 3 tok/s 정도였으니 PowerShell 측정값을 더 신뢰합니다)
토큰: 4,338
첫 토큰: 2.96s
캐시 적중: 1
합계: 963.32s
청크: 4318
[블록 6/8] 전력 측정기는 오는 중이지만, 제 추정으로는 전체 시스템 전력 소모가 약 130W 정도입니다(모니터 2대 연결됨, 모니터 전력은 제외). 각 GPU는 0.9V 언더볼팅 상태에서 30-40W를 사용했습니다. 작업 완료까지 약 16분이 걸렸고, 약 35와트를 소비했으며 비용은 0.0059유로가 들었습니다.
[블록 7/8] 업데이트:
OS는 Windows 11입니다.
[블록 8/8] 실제로 계산해보니 4338/960.02=4.52 tok/s가 나오네요. 왜 PowerShell에서 대부분의 시간 동안 3.5로 표시됐는지는 모르겠습니다. 웹 검색을 포함해서 요청을 하나 더 돌려봤더니 4.7 tok/s가 나왔습니다. 3.5에서 4.5 tok/s로 업데이트합니다.

