BeeLlama.cpp: 추론 및 비전 지원, DFlash와 TurboQuant를 탑재한 고급 llama.cpp 포크
BeeLlama.cpp: advanced DFlash & TurboQuant with support of reasoning and vision. Qwen 3.6 27B Q5 with 200k context on 3090, 2-3x faster than baseline (peak 135 tps!)
핵심 요약
RTX 3090에서 Qwen 3.6 27B 모델을 200k 컨텍스트로 빠르게 구동하는 성능 최적화 llama.cpp 포크.
- 성능 최적화 — DFlash 추론과 TurboQuant 압축으로 기존 대비 2~3배 빠른 속도 구현
- 멀티모달 지원 — 비전 모델과 200k 컨텍스트를 단일 RTX 3090에서 효율적으로 구동
- 추론 보호 — 반복적인 추론 루프를 감지하고 차단하는 기능 탑재
- 포크의 배경 — 기존 llama.cpp의 병목과 툴링 문제를 해결하기 위해 독자적인 최적화 적용
TL;DR 새로운 llama.cpp 포크입니다! 저는 단일 RTX 3090에서 추측적 디코딩(speculative decoding), 과도한 양자화 없는 높은 컨텍스트, 그리고 비전 기능을 사용하여 Qwen 3.6 27B Q5를 실행할 수 있는 윈도우 친화적인 추론 환경을 원했습니다. (이건 llama.cpp에 MTP PR이 올라오기 전의 이야기입니다.)
그래서 저는 오래된 비법을 꺼내 들었습니다: 새벽 4시까지 깨어 있기를 밥 먹듯이 하며 한 달 이상의 작업을 1~2주 만에 끝내는 것이죠. 이 모든 것을 작동시키려다 머리카락을 꽤 많이 잃은 것 같지만, 이제 제대로 된 해결책을 찾았고 공유해도 괜찮겠다는 생각이 들었습니다.
Anbeeld의 BeeLlama.cpp
GitHub 저장소: https://github.com/Anbeeld/beellama.cpp
BeeLlama.cpp(또는 Bee)는 로컬 GGUF 추론에서 더 많은 속도와 컨텍스트를 짜내기 위한 성능 중심의 llama.cpp 포크입니다. 기존 llama.cpp 도구와 서버 흐름을 유지하면서 DFlash 추측적 디코딩, 적응형 드래프트 제어, TurboQuant/TCQ KV-캐시 압축, 추론 루프 보호 기능을 추가했으며, 완전한 멀티모달을 지원합니다.
페가수스는 아니지만, 꽤 비슷합니다.
단일 RTX 3090 또는 4090에서 Q5 + 200k의 사실상 무손실 KV 캐시 + 비전을 실행할 수 있는 플러그 앤 플레이 Qwen 3.6 27B 설정을 준비했습니다.
포크 기능
- DFlash 추측적 디코딩:
--spec-type dflash는 대상 모델과 함께 DFlash 드래프트 GGUF를 구동합니다. 대상 모델은 레이어당 4096 슬롯의 링 버퍼에 은닉 상태를 캡처하고, 드래프터는 가장 최근의--spec-dflash-cross-ctx은닉 상태 토큰을 교차 어텐션하여 대상 검증을 위한 드래프트를 제안합니다. - TurboQuant / TCQ KV-캐시 압축: 4배에서 7.5배 압축까지 5가지 캐시 유형(
turbo2,turbo3,turbo4,turbo2_tcq,turbo3_tcq)을 지원하며, 높은 비트 옵션은 많은 경우 사실상 무손실입니다. 와 로 독립적으로 설정할 수 있습니다.

