Skymizer Taiwan, 단일 카드에서 초대형 LLM 추론을 가능하게 하는 혁신적인 아키텍처 공개
Skymizer Taiwan Inc. Unveils Breakthrough Architecture Enabling Ultra-Large LLM Inference on a Single Card
핵심 요약
6개의 HTX301 칩과 384GB 메모리를 탑재해 단일 카드에서 700B 모델 추론을 지원하는 새로운 아키텍처가 공개됨.
- 혁신적 아키텍처 — 6개의 HTX301 칩과 384GB 메모리로 단일 카드에서 700B 모델 추론을 지원함.
- 추론 단계 분리 — GPU는 연산 집약적인 프리필을, HTX301 카드는 메모리 집약적인 디코드를 담당함.
- 비용 효율성 논란 — 엔비디아 하드웨어 대비 저렴할 것으로 예상되나 실제 성능과 가격은 컴퓨텍스에서 확인해야 함.
- 기술적 의문 — LPDDR5X 사용 여부와 카드 간 데이터 전송 시 발생하는 레이턴시 문제에 대한 의구심이 제기됨.
기사 발췌:
단일 PCIe 카드(6개의 HTX301 칩과 384GB 메모리 탑재)를 통해 기업들은 이제 카드당 약 240W의 전력으로 700B 파라미터 모델 추론을 로컬에서 실행할 수 있게 되었다.
실제 추론 지연 시간의 대부분은 메모리 대역폭을 많이 사용하는 토큰 생성 단계에서 발생한다. 기존 GPU는 연산 집약적인 프리필(prefill)을 처리하고, HTX301 카드는 디코드(decode)를 처리한다. 각 실리콘이 각 단계에 최적화된 셈이다.
정말 흥미로운 접근 방식이다.
GPU는 프리필 단계만 처리하게 하고, 모델 가중치와 디코딩을 포함한 나머지 모든 작업은 이 카드에서 완전히 실행된다. 이런 방식이라면 엄청난 VRAM을 가진 그래픽 카드를 찾아 헤맬 필요 없이 거대한 파라미터 모델을 돌릴 수 있다.
실제 제품이 현실에서 어떤 성능을 보여줄지는 6월 초 컴퓨텍스(Computex)를 기다려봐야 알 수 있을 것이다.

