BitCPM-CANN: Ascend NPU에서 구동하는 1.58비트 네이티브 LLM 학습
BitCPM-CANN: Native 1.58-Bit Large Language Model Training on Ascend NPU
핵심 요약
화웨이 Ascend NPU 환경에서 1.58비트 양자화 학습을 지원하는 BitCPM-CANN 모델군이 공개되었습니다.
- 기술적 성과 — 화웨이 Ascend NPU 환경에서 1.58비트 양자화 학습을 네이티브로 지원함.
- 성능 유지 — 1B, 3B, 8B 모델은 기존 풀 정밀도 모델 대비 95% 이상의 성능을 유지함.
- 학습 효율 — MiniCPM4와 동일한 데이터를 사용하여 3조 토큰 학습 모델과 대등한 성능을 냄.
- 생태계 확장 — CUDA 의존성 없이도 극저비트 LLM 학습이 가능하도록 파이프라인을 구축함.
논문: https://github.com/OpenBMB/MiniCPM/blob/main/docs/BitCPM_CANN.pdf
초록
우리는 화웨이 Ascend NPU 플랫폼에서 1.58비트(삼진법) 양자화 인식 학습(QAT)을 체계적으로 연구한 BitCPM-CANN을 소개합니다. 극저비트 LLM의 두 가지 실무적 격차, 즉 삼진법 가중치가 온디바이스 규모의 복잡한 추론 작업에서 능력을 유지하는지, 그리고 CUDA 생태계 외부에서 엔드투엔드 1.58비트 학습을 네이티브로 구현하는 방법을 해결하기 위해, 우리는 기존 GPU 기반 파이프라인을 CANN, MindSpeed, Megatron-LM으로 포팅했습니다. 또한 아키텍처와 사전 학습 데이터 측면에서 풀 정밀도 MiniCPM4와 엄격하게 일치하는 4개의 모델(BitCPM-CANN-0.5B/1B/3B/8B)을 학습시켰습니다. 상식 추론, 도메인 지식, 수학 및 추론을 아우르는 11개 벤치마크에서 1B, 3B, 8B 모델은 풀 정밀도 성능의 95.7%~97.2%를 유지했으며, 3B 모델은 BBH에서 동등한 성능을 달성했고 3B/8B 모델은 GSM8K 성능을 거의 완전히 회복했습니다. 0.5B 모델은 90.1%를 유지했으나 수학 분야에서 잔여 격차가 집중되어 있어, 용량...
BitCPM-CANN은 MiniCPM4와 동일한 데이터를 사용하여 삼진법으로 처음부터 학습되었습니다. MiniCPM4 8B는 36조 토큰으로 학습된 Qwen3-8B와 비교할 만한 성능을 단 8조 토큰만으로 달성했습니다. (MiniCPM4는 작년에 출시되었습니다: https://arxiv.org/abs/2506.07900)

