주식 채널 영상 1,000개로 RAG 데이터셋을 구축해 보니 알게 된 트랜스크립트 품질에 대한 통찰
Built a RAG dataset from 1000 videos of one stock trading channel — here's what I learned about transcript quality
핵심 요약
주식 유튜버의 영상 1,000개 트랜스크립트를 LLM으로 분석해 일관성과 신뢰성을 검증한 사례입니다.
- 일관성 검증 — 영상 1,000개를 분석해 발언의 모순을 찾아냄
- 신뢰도 평가 — 순간적인 설득력이 아닌 장기적인 논리 일관성을 확인
- AI 활용 — 대규모 데이터에서 반복되는 패턴과 일회성 주장을 구분
- 데이터 품질 — 자동 생성된 트랜스크립트의 오류는 분석에 큰 지장이 없음
주식 거래 유튜브 채널이 실제로 일관된 말을 하는지, 아니면 영상마다 모순된 말을 하는지 확인하고 싶었습니다. 그래서 그 채널의 영상 거의 1,000개에서 트랜스크립트를 추출해 전체 내용을 LLM에 돌려봤습니다.
몇 가지 배운 점이 있습니다:
- 이런 방식으로 일관성을 확인할 수 있습니다. 영상 몇 개를 볼 때는 모든 내용이 자신감 있고 설득력 있게 들립니다. 하지만 1,000개의 트랜스크립트를 모두 확보해서 비교해 보면, 날짜나 시장 상황에 따라 조언이 모순되는 지점이 보이기 시작합니다. 영상 몇 개만 봐서는 절대 잡아낼 수 없는 부분이죠. 전체 세트가 필요합니다.
- 상대방이 실제로 신뢰할 만한지 확인하는 좋은 방법입니다. 영상 몇 개가 설득력 있게 들린다고 해서 크리에이터를 무작정 믿는 대신, 수백 개의 영상에 걸쳐 논리가 유지되는지, 아니면 일관된 전략이라기보다는 '그 순간에만 그럴듯하게 들리는' 말이었는지 확인할 수 있었습니다.
- 이 규모에서는 AI가 훨씬 유용합니다. 1,000개의 영상을 컨텍스트로 삼으면 LLM에게 반복되는 패턴과 일회성 주장을 찾아달라고 요청할 수 있습니다. 직접 10~20개의 영상을 보는 것보다 훨씬 더 나은 그림을 보여줍니다.
품질에 대한 부연 설명: 자동 생성된 트랜스크립트에는 구두점이 없고 일부 기술/금융 용어가 엉망이지만, 여기서는 큰 문제가 되지 않았습니다. LLM이 작업하기에 충분히 명확한 내용이었습니다.
1,000개의 트랜스크립트를 하나씩 다운로드하는 건 현실적이지 않아서 결국 이 작업을 위한 작은 도구를 만들었습니다. 나중에는 아주 작은 사이드 프로젝트 제품으로 만들었고요.
