인상적인 Freetokens 프로젝트
Freetokens project is impressive
핵심 요약
새로 공개된 Freetokens 프로젝트의 성능을 테스트한 후기 공유와 이에 대한 커뮤니티의 기술적 논쟁.
- 프로젝트 성능 — RTX 5080 환경에서 Qwen3.6-35B-A3B 모델로 100tok/s 달성함
- 기술적 의구심 — 기존 llama.cpp 기능과 차별점이 부족하다는 비판 제기됨
- 벤치마크 신뢰성 — 평가 방식의 투명성과 데이터 재현 가능성에 대한 의문 제기됨
- 성능 비교 — 사용자들 간의 하드웨어 사양 및 벤치마크 환경에 따른 속도 차이 논의됨
어제 새로운 프로젝트 하나 풀렸길래 오늘 바로 테스트해 봄.
Papper: https://arxiv.org/abs/2608.16157
Github: https://github.com/FlashML-org/FreeToken
내 테스트 환경은 이럼:
RTX 5080 (16 GB)
DDR6 64GB
AMD Ryzen 9 9950X3D
QWEN3.6-35B-A3B NVFP4 (20GB라 내 VRAM엔 안 들어감) 돌려보니까 100tok/s 나오더라.
너네도 벌써 써봤냐?
(아래는 1028 토큰 프롬프트 넣었을 때 예시 - 대충 110 tok/s 나옴)



