BeeLlama v0.2.0 – 대규모 DFlash 업데이트. RTX 3090 한 장으로 Qwen 3.6 27B 최대 164 tps(4.40배), Gemma 4 31B 최대 177.8 tps(4.93배) 달성. 프롬프트 처리 속도는 베이스라인 수준 유지.
BeeLlama v0.2.0 – major DFlash update. Single RTX 3090: Qwen 3.6 27B up to 164 tps (4.40x), Gemma 4 31B up to 177.8 tps (4.93x). Prompt processing speed near baseline.
핵심 요약
RTX 3090에서 Qwen과 Gemma 모델의 추론 속도를 4배 이상 획기적으로 높인 BeeLlama v0.2.0 업데이트.
- 성능 최적화 — DFlash 기술을 통해 RTX 3090 환경에서 Qwen 3.6 및 Gemma 4 모델의 토큰 생성 속도를 4배 이상 향상함.
- 주요 개선 사항 — DFlash 오버헤드 감소, 프리필 처리 개선, 드래프터 K/V 캐싱 최적화 등을 통해 전반적인 추론 안정성을 높임.
- 벤치마크 결과 — 다양한 작업 환경에서 베이스라인 대비 3~4배 이상의 속도 향상을 기록하며 프롬프트 처리 속도는 기존과 동일하게 유지함.
- 향후 계획 — MoE 모델 지원 및 추가적인 모델 최적화를 위한 별도의 업데이트를 준비 중임.
BeeLlama v0.2.0이 출시되었습니다!
페가수스는 아니지만, 뭐 비슷하긴 하지.
GitHub | Qwen 3.6 27B Quick Start | Gemma 4 31B Quick Start
- 효율적인 DFlash 구현 및 비전을 포함한 Gemma 4 31B 완벽 지원.
- DFlash 오버헤드 감소, 더 깔끔한 프리필 처리, 드래프터 K/V 프로젝션 캐싱, 더 안전한 CUDA 실행을 통한 Qwen 3.6 27B 성능 대폭 업데이트.
- 업스트림 아키텍처를 사용하는 DFlash GGUF 지원.
- 베이스라인 프로빙 관련 적응형 수익(adaptive profit) 동작 수정.
- 축소된 검증기 경로가 더 엄격해졌으며, 문법, 샘플러 상태 또는 추론이 필요할 때 전체 로짓으로 안전하게 폴백됨.
- 추론 및 도구 호출 경계가 더 타이트해짐.
- 더 엄격한 드래프트/타겟 검증 및 더 나은 드래프트 모델 탐색.
- ...그 외 다수의 개선 사항!
벤치마크
- 사양: Windows 11, AMD Ryzen 7 5700X3D, 32 GB DDR4 RAM, RTX 3090 24 GB
- 설정: 퀵 스타트 문서와 동일, 단 비채팅 프롬프트는 추론 기능 끔
- 비교 대상 베이스라인 및 MTP 서버: llama.cpp b9275 CUDA 13.1 Windows 빌드
- 벤치마크 프롬프트 전문은 GitHub의 README.md에서 확인 가능
Qwen 3.6 27B
타겟 모델: Qwen 3.6 27B Q5_K_S 또는 Qwen 3.6 27B MTP Q5_K_S. DFlash 모델: Q4_K_M.


