Tencent-HY3, 128GB 환경에서 진짜 물건이네!
Tencent-HY3 is the real deal on 128GB!
핵심 요약
Tencent의 신규 모델 HY3를 128GB 환경에서 테스트한 결과, DeepSeek v4 Flash보다 뛰어난 성능과 속도를 보여줌.
- HY3 모델 성능 — DeepSeek v4 Flash 대비 코딩 능력 우수 및 벤치마크 점수 상회함
- 설정 및 최적화 — llama.cpp PR #25395를 통해 구동하며 MTP 적용 시 속도 19% 향상됨
- 하드웨어 요구사항 — 128GB VRAM 환경에서 원활하게 작동하며 GPU 메모리 제한 해제 필요함
- 모델 한계점 — DeepSeek 대비 컨텍스트 윈도우가 작아 대규모 작업 시 제약이 있을 수 있음
HY3 써보고 진짜 감탄했다. 혹시 이 모델 모르는 사람 있을까 봐 말하는데, 텐센트에서 새로 내놓은 295B-A21B MoE 모델임. 오픈 웨이트 모델 최전선에서 경쟁하는 놈인데, 크기는 훨씬 작으면서 DeepSeek v4 Flash랑 비비거나 벤치마크는 더 잘 나옴. 이 기사 보고 흥미가 확 생겨서, 마침 내 Macbook M5 Max 128GB 환경에서 antirez의 DeepSeek V4 Flash 퀀트(dwarfstar에서 돌리던 거)를 Unsloth의 IQ3_XXS(mainline llama.cpp)로 업데이트한 참이었거든. 이거 돌릴 수만 있으면 제대로 비교해 볼 수 있겠다 싶어서 바로 조사 들어갔고, 알아낸 건 다음과 같음.
일단 퀀트 모델부터 골라야 했음. 허깅페이스에 몇 개 올라와 있는데, 비교 좀 해보다가 이 UD128 "unsloth dynamic" 스타일 107GB 퀀트로 정함. 내가 찾을 당시엔 PPL 수치 공개된 게 이거밖에 없었거든. KLD는 아니지만, 그래도 제작자가 품질 저하를 신경 쓰고 있다는 증거니까. 다이내믹 3비트 퀀트치고 PPL도 나쁘지 않았고, 내가 쓰던 UD DS4 퀀트랑 비슷한 체크포인트 느낌이었음.
다음은 llama.cpp 세팅. 퀀트 설명란에 친절하게 적혀있듯이, PR #25395가 이 모델이랑 내장 speculative decoding 모듈을 한 번에 지원해 줌! 빌드 바로 때리고 돌려봤음:
git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp
git fetch origin pull/25395/head:hy3 && git checkout hy3
cmake -B build -DGGML_METAL=ON -DGGML_METAL_EMBED_LIBRARY=ON
cmake --build build --config Release -j
맥 GPU 메모리 제한 기본값 96GB에서 올리는 거 까먹지 마라! 난 24k 컨텍스트 테스트하려고 122GB로 잡았음(재부팅하면 초기화됨):
sudo sysctl iogpu.wired_limit_mb=124928
근데 막상 돌려보니까 llama.cpp가 모델 인식을 못 해서 서버 에러 터지더라. 로그랑 퀀트 설명란 다시 보니까 이유가 있었음: "이 파일들은 general.architecture = hy-v3 (이 포트의 원래 이름)로 되어 있는데, PR #25395는 아키텍처를 hy_v3 (언더바)로 등록함". 좀 더 꼼꼼히 봤으면 삽질 안 했을 텐데, 그냥 문자 바꿔주는 스크립트 하나 짰음(GGUF 샤드 3개 중 첫 번째 파일에만 21군데 있더라). 필요하면 공유해 줄 수 있는데, 솔직히 그냥 AI한테 시키면 2분 만에 고쳐줌. 런칭 스크립트 다시 돌리니까 SSD에서 107GB 읽느라 30초 정도 쫄리는 시간 지나고 WebUI 딱 뜨더라. 바로 실행 완료!
벤치마크 (M5 Max, llama-bench, Metal, q8_0 KV cache, MTP off)
| test | tokens/sec |
|---|---|
| prefill pp512 @ empty ctx | 528 |
| decode tg128 @ empty ctx |



