llama.cpp b9095 버전 출시: 듀얼 Blackwell PCIe 환경에서 NCCL 없이 텐서 병렬 처리 지원
NCCL-Free Tensor Parallelism on Dual Blackwell PCIe llama.cpp b9095 released!
핵심 요약
llama.cpp b9095 버전이 듀얼 Blackwell PCIe GPU에서 NCCL 없이 텐서 병렬 처리를 지원하여 성능을 크게 개선함.
- 텐서 병렬 처리 — NCCL 없이 듀얼 Blackwell PCIe GPU에서 텐서 병렬 연산 지원
- 성능 향상 — 35B MoE 모델 기준 118% 이상의 토큰 생성 속도 개선 확인
- 호환성 확대 — Volta 아키텍처 이후 모든 NVIDIA GPU에서 내부 커널 사용 가능
- 데드락 해결 — Blackwell PCIe 환경의 고질적인 데드락 문제 수정
b9095 버전에서 드디어 -sm 텐서 병렬 처리가 NCCL 없이 듀얼 소비자용 Blackwell PCIe GPU에서 작동하게 되었습니다.
듀얼 Blackwell GPU를 사용 중이라면 큰 변화가 될 것입니다.
2x5060ti 환경에서의 테스트 결과를 곧 공유하겠습니다.


