에이전트 메모리를 위해 챗봇 대화 내역을 임베딩해봤는데, 브라우저 자동 완성이 훨씬 나은 데이터셋이었음
tried embedding my chat exports for agent memory, browser autofill ended up being a better corpus
핵심 요약
AI 에이전트의 개인화된 메모리를 구축할 때 챗봇 대화 로그보다 브라우저의 자동 완성 및 방문 기록이 훨씬 유용한 데이터셋이라는 경험담.
- 데이터셋 선정 — 챗봇 대화 로그보다 브라우저 자동 완성 데이터가 에이전트 맥락 파악에 더 효과적임
- 개인화된 에이전트 — 사용자의 실제 생활 패턴이 담긴 웹 데이터가 에이전트의 업무 수행에 핵심적인 역할을 함
- 데이터 추출 방식 — 크롬의 Web Data sqlite와 방문 기록을 활용해 에이전트용 로컬 데이터베이스를 구축함
로컬 Llama 에이전트에게 이메일 초안 작성이나 예약 같은 업무를 맡기려고 3주 정도 매달려봤음. 처음에는 ChatGPT와 Claude 대화 내역을 인덱싱하고 메시지를 임베딩해서 RAG를 돌려봤는데, 결과가 영 별로였고 최근에 불평했던 내용에만 편향되는 문제가 있었음.
결국 크롬의 Web Data sqlite(자동 완성 및 저장된 카드 정보)와 History db, 북마크를 읽어서 태그가 달린 로컬 sqlite로 덤프하는 간단한 추출기를 만들었음. 이게 내 대신 업무를 수행하는 에이전트에게 필요한 맥락의 80% 정도를 차지하더라. 내 실제 생활의 절반은 폼 필드 입력이나 자주 방문하는 탭에 녹아있는데, 대화 기록에는 그런 게 거의 안 남거든.
요즘 나오는 '개인용 AI' 데모들은 여전히 대화 로그 인덱싱부터 시작하던데, 그건 잘못된 데이터셋이라고 생각함.

