Qwen3-VL 임베딩을 활용한 로컬 비디오 시맨틱 검색 (API 및 전사 불필요)
Semantic video search using local Qwen3-VL embedding, no API, no transcription
핵심 요약
API나 전사 과정 없이 Qwen3-VL 임베딩을 사용하여 로컬 환경에서 비디오를 자연어로 검색하는 도구.
- 로컬 비디오 검색 — API나 전사 없이 Qwen3-VL 임베딩으로 비디오 클립을 자연어로 검색함.
- SentrySearch 도구 — ChromaDB를 활용해 비디오를 인덱싱하고 검색 및 자동 트리밍을 지원함.
- 하드웨어 요구사항 — 8B 모델은 약 18GB, 2B 모델은 약 6GB RAM이 필요하며 Apple Silicon과 CUDA를 지원함.
- 기술적 구현 — HuggingFace Transformers를 통해 원본 가중치를 직접 실행하며 단일 단계 검색을 수행함.
저는 네이티브 비디오 검색을 위해 Qwen3-VL-Embedding을 실험해 왔는데, 원본 비디오를 텍스트 쿼리와 함께 벡터 공간에 직접 임베딩하는 방식입니다. 전사도, 프레임 캡셔닝도, 중간 텍스트도 필요 없습니다. 자연어로 검색하면 비디오 클립과 매칭됩니다.
놀라운 점은 8B 모델이 완전히 로컬에서 실행되면서도 실제로 쓸만한 결과를 만들어낸다는 것입니다. Apple Silicon(MPS)과 CUDA에서 테스트했습니다. 8B 모델은 약 18GB RAM이 필요하고, 2B 모델은 약 6GB에서 실행됩니다.
저는 이를 기반으로 CLI 도구(SentrySearch)를 만들었는데, 영상을 ChromaDB에 인덱싱하고 검색하며 매칭되는 클립을 자동으로 잘라줍니다. 원래는 Gemini 임베딩 API 기반으로 만들었지만, 많은 분들의 요청으로 로컬 Qwen 백엔드를 추가했습니다.
혹시 다른 분들도 비디오 작업에 Qwen3-VL-Embedding을 사용해 보셨나요? 클라우드 임베딩 모델과 비교했을 때 품질이 어떤지 궁금합니다.
(데모 영상 첨부, 참고로 이 영상은 Gemini 백엔드를 사용하여 녹화되었지만, 로컬 백엔드도 --backend local 플래그를 사용하면 동일하게 작동합니다)



