Le Chaton FAT을 맞이할 준비 되셨나요, 아니면 여전히 GPU에 돈 낭비 중이신가요?
Are you ready for Le Chaton FAT or still wasting money on GPUs?
핵심 요약
대규모 로컬 추론을 위해 GPU 대신 대용량 SSD와 ZFS를 활용한 독특한 인프라 구축 사례입니다.
- 인프라 구축 — 12개의 3.2TB SSD를 활용해 60GB/s 대역폭과 30TB 저장 공간 확보함
- 데이터 관리 — ZFS raidz2를 사용하여 데이터 손실 방지 및 스냅샷 기능 활용함
- 추론 성능 — SSD 기반 추론으로 초당 1토큰 정도의 속도를 예상함
- 기술 논쟁 — MoE 아키텍처의 활성 파라미터 수와 SSD 추론의 실효성을 두고 토론함
소문에 따르면(내가 퍼뜨린 거지만) Le Chaton FAT은 26T-a3b가 될 거고, 난 이미 준비 완료임.
솔직히 말해서 5060Ti를 그렇게 많이 살 여유는 없어서, 12x Gen 4 3.2TB(카드당 2개)를 구했음. 이걸로 30TB 용량에 약 60GB/s 대역폭이 나옴.
KV 캐시용으로만 256GB DDR4를 추가했는데, 디스크에 KV 캐시를 쓸 수도 있음. 내구성이 높은 드라이브들이라 괜찮음.
로컬 추론의 다음 시대를 맞이할 준비 됐음?
농담은 제쳐두고, 이게 내가 HF_HOME으로 사용하는 모델 및 데이터셋 저장소임. 컨테이너 몇 개도 설정 중인데, 무거운 연산 작업은 안 돌림. CPU는 고작 3945WX(12c/24t)거든.
풀은 raidz2로 구성해서 에이전트가 뭘 삭제할까 봐 걱정할 필요가 없음. 그냥 zfs snapshot만 하면 되고, rm -rf foo-bar 같은 명령어를 쳐도 식은땀 흘릴 일이 없음.


