Basalt: Blackwell 아키텍처 기반 추론 엔진, 5090 + 5060 Ti 환경에서 665 tok/s 달성
Basalt: Flash-Next at 665 tok/s structured, 354 prose on a 5090 + 5060 Ti (2.6x Strata)
핵심 요약
Blackwell 아키텍처와 Qwen3.8 Flash-Next에 최적화되어 압도적인 추론 속도를 제공하는 오픈소스 엔진 Basalt를 소개합니다.
- 압도적 속도 — 5090+5060 Ti 환경에서 구조화된 데이터 665 tok/s, 일반 텍스트 354 tok/s 달성
- Blackwell 전용 — 최신 아키텍처와 Qwen3.8 Flash-Next에 특화된 커널 최적화 적용
- 오픈소스 공개 — MIT 라이선스로 배포되며 커스텀 비전 인코더 및 MTP 드래프터 포함
- 성능 논란 — 속도 최적화 과정에서 모델 정확도(KLD)가 저하될 수 있다는 우려 제기
Basalt: Blackwell inference engine
다들 안녕! 지난 일주일 동안 Strata 포크 버전 하나를 빡세게 튜닝해 봤는데, 같은 가중치로 기존 Strata 대비 처리량(throughput)을 최대 2.6배까지 뽑아내더라. 이건 Qwen3.8 Flash-Next랑 Blackwell 아키텍처만 지원하는 전용 엔진으로 만들었어. 내 현재 하드웨어(5090 + 5060 Ti - 9950X 32GB DDR5 RAM) 같은 듀얼 GPU 환경에 최적화돼 있지. Basalt 주요 특징은 다음과 같아:
- 속도: 64k 컨텍스트에서 665 struct, 354 prose, 7,317 prefill, IQ3_XXS, 400 W. 속도가 핵심임.
- 5090 단일 카드도 가능(보조 카드 없이): IQ3_XXS 기준 585 struct, 316 prose. 5060 Ti 쓸 때보다 12% 정도 느리고 prefill은 동일함.
- 최대 8명까지 실시간 동시 접속 지원: 공유 KV나 슬롯별 할당 가능, MTP 활성화 시 8개 스트림 합쳐서 623 tok/s 나옴(비교할 Strata 수치가 없네).
- 낮은 양자화(quant)에서도 처리량 높이려고 MTP 미세 조정함.
- 바닥부터 새로 짠 커스텀 비전 인코더. GPU에선 llama.cpp보다 최대 3배, CPU에선 4배 빠름.
- 현재 처리량(동시 접속 통계 포함), 전문가 분포, 하드웨어 상태 보여주는 심플한 서버 UI. 채팅 기능은 없고, 알아서 가져다 쓰면 됨(BYOH).
- OpenAI + Anthropic 호환.
- 리눅스만 지원(윈도우나 맥은 안 됨).
Basalt는 NInfer랑 비슷한 방식을 써. 가중치를 .basalt 파일 하나로 재패킹(재양자화 아님)해서 메타데이터, 비전, MTP까지 다 때려 박았으니까 양자화 버전별로 파일 하나만 관리하면 돼. 일단 ISTA-DASLab의 GSQ-RCO(Q2, IQ3_XXS, IQ3_S)랑 Unsloth의 UD-Q4_K_XL, Q8부터 지원하니까 VRAM/RAM 예산이랑 취향에 맞춰서 골라 쓰면 됨.
간단 Q&A:
+ 오픈소스임?
- 당연하지, MIT 라이선스 완전 오픈소스임: https://github.com/jesdga95/basalt. 포크 떠서 개선하고 친구든 적이든 다 공유해.
+ 가중치는 어디 있음?
- 여기: https://huggingface.co/jesdga/Qwen3.8-Flash-Next-Basalt. 입맛대로 골라 잡아. 빠르고 멍청한 거든, 똑똑하고 느린 거든. IQ3_S가 딱 중간 정도라 쓸만함(내 환경에서 top 1 일치율 약 89%, prose 기준 300 tok/s).

