[논문] xHC: 확장된 하이퍼 커넥션 - 잔차 스트림을 더 넓게 확장하여 모델 지능을 극대화하다
[Paper] xHC: Expanded Hyper-Connections - Scale Residual Streams Wider · Push Model Intelligence Further
핵심 요약
잔차 스트림을 N=16까지 효율적으로 확장하여 모델 성능을 높이고 학습 비용을 절감하는 xHC 아키텍처 제안.
- xHC 아키텍처 — 잔차 스트림을 N=16까지 확장하여 모델 지능을 향상함.
- 학습 효율성 — 기존 mHC 대비 19%, 기본 모델 대비 50%의 연산 비용을 절감함.
- xHC-Flash — 확장된 잔차 상태의 메모리 트래픽을 효과적으로 제어함.
- 성능 개선 — 18B 및 28B MoE 모델에서 일관된 다운스트림 성능 향상을 입증함.
하이퍼 커넥션(HC)은 트랜스포머의 잔차 스트림을 N개의 병렬 스트림으로 확장하여 모델의 너비와 깊이를 넘어선 메모리 스케일링을 제공합니다. 매니폴드 제약 HC(mHC)는 이러한 구조를 대규모에서 안정화합니다. N=1에서 N=4로의 큰 성능 향상은 잔차 스트림 확장이 유망한 스케일링 축임을 시사합니다. 그러나 기존 HC 계열 방식은 일반적으로 N=4에서 멈춥니다. 저희 실험 결과 그 이유가 밝혀졌는데, mHC를 이 지점 너머로 확장하면 성능 향상은 줄어들고 학습 비용은 급격히 증가하기 때문입니다. 이러한 한계는 두 가지 병목 현상 때문입니다. 스트림 수가 늘어남에 따라 쓰기 복구(write-back) 정보가 부족해지고, 잔차 혼합 생성 비용이 N의 세제곱에 비례하여 증가하는 것입니다. 이 두 병목 현상을 해결하기 위해, N=4를 넘어 의미 있는 확장을 달성한 최초의 HC 계열 방식인 xHC(Expanded Hyper-Connections)를 제안합니다. xHC는 더 풍부한 쓰기 복구를 위한 시간적 특징 증강과, 전체 잔차 상태에 대한 밀집 접근을 유지하면서 N=16개의 스트림 중 k=4개만 업데이트하는 희소 잔차 스트림 아키텍처를 결합합니다. 18B 및 28B MoE 모델 전반에서 xHC는 강력하고 일관된 다운스트림 성능 향상을 제공합니다. 18B MoE 모델에서 xHC는 기존 mHC 대비 평균 다운스트림 점수를 4.0점 향상시키면서도, 기본 베이스라인 대비 학습 FLOPs는 소폭 증가하는 데 그쳤습니다. 스케일링 법칙 실험에 따르면, 동일한 손실 값에 도달하기 위해 베이스라인과 mHC는 xHC 대비 각각 1.50배와 1.19배의 연산량이 필요합니다. 실용적인 대규모 N 학습을 위해서는 확장된 잔차 상태에서 발생하는 메모리 트래픽 제어도 필요합니다. 따라서 서브레이어당 메모리 트래픽을 73.5C에서 40C로 줄여주는 xHC-Flash를 도입했습니다. 이는 N=4일 때 mHC가 요구하는 34C와 비슷하면서도 xHC의 성능 향상 효과는 그대로 유지합니다. 결론적으로 xHC와 xHC-Flash는 대규모 N 잔차 스트림 확장을 LLM 사전 학습에 효과적이고 실용적으로 만들어 줍니다.
arXiv : https://arxiv.org/abs/2607.14530
Full Paper : https://arxiv.org/pdf/2607.14530
GitHub : https://github.com/aHapBean/xHC
