솔직히 말할게, Strata가 llama.cpp를 완전히 압살했음
Imma just say it, Strata absolutely clowned llama.cpp
핵심 요약
llama.cpp의 느린 개발 속도를 비판하며 고성능 대안인 Strata를 추천하는 글에 대해 커뮤니티의 의견이 갈리고 있습니다.
- llama.cpp 비판 — MoE 캐싱 등 기능 도입이 늦고 PR 관리가 폐쇄적임
- Strata의 성능 — 특정 모델에서 압도적인 prefill 및 decode 속도를 보여줌
- 범용성 논란 — llama.cpp는 범용 엔진이고 Strata는 특정 모델 전용이라는 반론
- 오픈소스 생태계 — 무료 봉사하는 개발자들에 대한 존중과 비판 사이의 갈등
내가 1년 내내 llama.cpp에 MoE 캐싱 좀 넣어달라고 애원했는데, 그 새끼들은 1%니 2%니 하는 쥐꼬리만한 개선이나 하면서 시간만 죽치고 있더라.
그러다 Strata(https://github.com/Niko1221/Strata)가 나타나서 2주 만에 프리필 5~10배, 디코드 3~4배 성능으로 llama를 그냥 개박살 내버림.
그동안 llama에 관련 PR도 수두룩하게 올라왔고, 개념 증명하는 논문도 arXiv에 널리고 널렸었음.
근데 돌아오는 건? 아무것도 없음. 그냥 침묵뿐.
아, 딱 하나 있긴 하네. "귀찮아서 안 읽을 거니까 닫음 ㅅㄱ" 같은 꼬라지들.
llama.cpp 메인테이너들이 평범함에 이 정도로 집착하는 거 보면 진짜 대단할 지경임.
그러니까 다들 알아둬라. Strata 써라. 8~16GB VRAM에 64GB RAM 환경에서 Qwen-3.8-flash-next 돌리는데, 거의 Luna급 성능 나옴. 속도는 27b 모델보다 빠르거나 비슷하고(2000/70 t/s 이상)?
개꿀이네.


