나 같은 GPU 빈민들을 위해:
llama.cpp(llama-server)를 통한 GGUF 구동
llama.cpp는 GGUF 모델을 OpenAI 호환 API의 임베딩 엔드포인트로 제공하는 것을 기본적으로 지원하며, 풀링(pooling) 타입 설정도 지원함.
1. Qwen3-8B GGUF 다운로드
원하는 양자화 버전(예: Q4_K_M, Q5_K_M, 또는 Q8_0)을 다운로드.
2. 임베딩 모드로 llama-server 시작
--embedding 옵션으로 llama-server를 실행하고, 풀링 타입을 last로 명시적으로 설정(버전에 따라 last 또는 cls를 지원하지만, CLM은 특히 last-token 풀링이 필요함):
codeBash
llama-server
-m ./qwen3-8b-Q4_K_M.gguf
-c 8192
--embedding
--pooling last
--port 8090
llama.cpp 임베딩 참고: 빌드가 --pooling last를 지원하는지 확인(최신 버전은 --pooling 플래그로 지원). 생략 시 일부 구버전은 mean 풀링을 기본값으로 사용하는데, 이는 헤드가 last-token 표현으로 학습되었기 때문에 CLM의 점수 정확도를 떨어뜨림.
3. clm-serve 연결
CLM 서비스를 llama-server 인스턴스에 연결:
codeBash
clm-serve
--port 8700
--emb-url http://127.0.0.1:8090/v1/embeddings