NVIDIA Nemotron 페르소나를 위한 임베딩
Embeddings for NVIDIA's Nemotron Personas
핵심 요약
NVIDIA Nemotron 페르소나 데이터셋을 쉽게 검색하고 클러스터링할 수 있도록 Qwen 0.6B로 임베딩 벡터를 추출했습니다.
- 데이터셋 활용 — 수백만 개의 페르소나 정보를 효율적으로 검색하기 위해 임베딩 벡터를 추출함.
- 기술 스택 — 경량 모델인 Qwen 0.6B를 사용하여 의미론적 검색 및 K-최근접 이웃 분석을 수행함.
- 제공 리소스 — 한국, 일본, 프랑스, 미국 등 국가별 사전 계산된 임베딩 벡터와 웹 데모를 공개함.
nvidia/Nemotron-Personas 데이터셋의 임베딩 벡터를 추출했습니다.
이 데이터셋은 이름, 나이, 직업, 취미 등 상세한 배경을 가진 수백만 개의 합성 페르소나로 구성된 엄청난 자원이지만, 특정 페르소나를 찾거나 클러스터링하기가 어렵습니다. 이를 해결하기 위해 Qwen 0.6B를 사용하여 임베딩을 계산했습니다. 0.6B 모델은 가볍지만, 의미론적 검색을 실행하거나 K-최근접 이웃(K-Nearest Neighbors)을 찾아 페르소나 그룹을 구축하는 데 완벽하게 작동합니다.
사전 계산된 임베딩 벡터(한국, 일본, 프랑스, 미국)를 확인할 수 있습니다. 웹 데모도 확인해 보세요.
- 데이터셋: https://huggingface.co/collections/tantara/nemotron-personas-embedding
- 웹 데모: https://www.microworld.dev/
어떻게 생각하시는지, 혹은 로컬 에이전트 프로젝트에 사용하게 된다면 알려주세요!


