대박!! CMP 170HX 잠금 해제 성공: 6.3 → 193 TFLOPS, pp512 599 → 3468, 그리고 이 카드에 대한 커뮤니티 조언 절반은 틀렸음.
BEAST!! Unlocked a CMP 170HX: 6.3 → 193 TFLOPS tensor, pp512 599 → 3468, and half the community's advice about this card is wrong.
핵심 요약
CMP 170HX의 하드웨어 잠금을 해제하여 A100급 성능을 끌어내고 기존의 잘못된 기술적 통념을 바로잡음.
- 성능 극대화 — 하드웨어 잠금 해제로 텐서 연산 처리량을 30배 이상 향상함.
- 효율성 입증 — 3090 2개보다 적은 전력으로 더 빠른 추론 성능을 보여줌.
- 통념 반박 — 기존에 알려진 텐서 코어 제한이 사실은 일반적인 암페어 아키텍처 동작임을 증명함.
- 실제 활용 — vLLM 환경에서 대규모 컨텍스트 처리가 가능함을 확인함.
방금 CMP 170HX를 손에 넣었는데, 부팅해보니 좀 실망스럽더라. 이거 완전 A100 실리콘 그 자체거든. 텐서 코어는 완전히 병신을 만들어놔서 pp t/s를 다 조져놨고, 64GB 메모리 중 56GB는 펌웨어로 잠겨있음. 살 때 VRAM은 풀 수 있다는 건 알았는데 텐서 코어까지 이럴 줄은 몰랐지. 그래서 하루 종일 명령어 수준에서 뭐가 실제로 바뀌는지 측정해봤다.
스로틀링은 모든 MMA 명령어마다 256사이클 스톨이 하드코딩되어 있음. 255.8도 아니고 256.4도 아님. 3,500번 샘플링했는데 오차 없이 정확히 256.0이더라. 물리적 한계치가 딱 떨어지는 이진수로 나올 리가 없지. 이건 그냥 레지스터 값 박아놓은 거임.
락을 풀면 이게 24.0 사이클로 떨어지는데(참고로 RTX 3090은 32.9 나옴), 텐서 처리량은 6.3 → 193 TFLOPS로 떡상함. A100 풀 스펙 대비 SM당 성능의 95% 수준이야.
실제로 돌려보면: llama.cpp pp512 기준 599.6 → 3468 tok/s (5.8배) 찍히고, vLLM에서 Qwen3.8-27B-FP8 서빙할 때 170HX 한 장이 내 3090 2장 텐서 병렬 구성보다 프리필(prefill) 성능이 더 잘 나옴. 전력 소모는 454W 먹던 걸 197W로 컷했고.
이 카드에 대해 흔히들 하는 조언 두 가지는 이제 완전히 틀린 말이 됐음. 아래에 데이터 정리해놨다. 그리고 네가 직접 락 풀린 거 확인해볼 수 있는 사이클 단위 프로브 코드도 같이 넣었으니까 10초만 투자해서 돌려봐라. 전력 제한이랑 상관없고 작업 돌리는 와중에도 안전하게 실행 가능함.


