Tencent의 Hy3 295B 모델을 1비트로 양자화했더니 클라우드 API보다 2.2배 빠르면서 품질 저하도 없었음
Our 1-bit quant of Hy3 295B runs 2.2x faster than the cloud API with no quality loss
핵심 요약
Hy3 295B 모델을 1비트로 양자화하여 RTX 5090 4대로 구동한 결과, 클라우드 API 대비 속도는 2.2배 빠르고 성능은 동일함을 확인했습니다.
- 1비트 양자화 — 295B 모델을 92GB IQ1_M GGUF로 압축하여 4-GPU 환경에서 구동함
- 성능 비교 — 클라우드 API와 동일한 작업 수행 시 속도는 2.2배 빠르고 결과물은 유사함
- 기술적 구현 — MTP 레이어를 유지하고 self-speculative decoding을 통해 효율성 확보
- llama.cpp 지원 — 최신 llama.cpp 마스터 빌드에서 즉시 실행 가능
Tencent의 Hy3 295B 모델을 1비트로 양자화하여 92GB IQ1_M GGUF 파일을 만들었고, 4-GPU 박스 하나에 들어갈 정도로 작게 만들었습니다. 우리는 이 모델을 RTX 5090 4대에서 구동하며 클라우드 API를 통한 동일한 Hy3 모델과 비교했습니다. 두 모델 모두 동일한 원샷 작업을 수행했습니다. 각 모델은 하나의 HTML 파일로 구성된 셀프 플레이 레트로 게임을 빌드했습니다. 우리는 Flappy Bird, Arkanoid, Snake를 사용하여 reasoning을 높게 설정하고 세 번의 라운드를 진행했습니다.
Hy3는 21B 활성 파라미터(192개 전문가, top-8, 80개 레이어)와 3.8B MTP 레이어를 가진 295B MoE 모델입니다. 우리는 자체 importance matrix와 calibration_datav3를 사용하여 원본 가중치에서 직접 양자화를 수행했습니다. 전문가 모델은 1비트 클래스로 떨어지지만, 어텐션, 임베딩, 출력 헤드는 q4-q8을 유지하여 약 2.5 bits/weight 수준이 됩니다. MTP 레이어는 그대로 유지되므로 llama.cpp가 self-speculative decoding으로 실행합니다. 메모리 사용량은 64K 컨텍스트에서 약 114GB로 준수합니다. hy_v3 아키텍처가 llama.cpp 마스터에 포함되었으므로, 새로 빌드하면 바로 실행 가능합니다.
결과:
Hy3 1-bit 로컬: 76.9K 토큰 · 15.5분 · reasoning 포함 약 83 tok/s
Hy3 클라우드 API: 75.1K 토큰 · 34.3분 · 약 37 tok/s
게임 결과는 비슷한 수준이었습니다. 새는 파이프를 통과하고, 벽돌은 깨지고, 뱀은 먹이를 먹고 자라났으며, 멈추거나 충돌하는 일은 없었습니다. 두 버전 모두 동일한 실수를 했는데, 뱀이 자기 몸을 가로지를 수 있고 게임이 절대 끝나지 않는다는 점입니다. 속도 차이는 MTP 드래프팅과 제로 큐(zero queue) 덕분입니다.
llama.cpp에서 테스트했으며, 이는 우리의 로컬 AI 앱인 Atomic.Chat을 구동하는 엔진과 동일합니다. (저는 Atomic 팀 소속이며, 질문 환영합니다.)


