TinySearch v0.6.1 - 로컬 LLM을 위한 경량 웹 검색 도구, 브라우저 연동 기능 추가
TinySearch v0.6.1 - still a lightweight web research tool for local LLMs, now with bring-your-own-browser support
핵심 요약
로컬 LLM의 컨텍스트 창을 효율적으로 관리하는 웹 검색 도구 TinySearch가 브라우저 연동 기능을 추가하여 업데이트되었습니다.
- 브라우저 연동 — 사용자가 직접 운영하는 브라우저 프로필과 쿠키를 활용해 스크래핑 가능함
- 토큰 최적화 — BM25와 로컬 ONNX 임베딩을 통해 웹 콘텐츠를 약 64% 압축함
- 검색 효율화 — 검색과 스크래핑 단계를 분리하여 불필요한 리소스 소모를 방지함
- MCP 지원 — XML 기반 응답 형식 도입으로 로컬 LLM과의 연동성 강화함
github.com
원문 사이트로 이동
다들 안녕,
몇 버전 전에 여기 TinySearch 올렸을 때 다들 피드백을 쏠쏠하게 줘서, 그동안 꽤 많이 바뀐 김에 업데이트 글 하나 올린다.
Repo:
https://github.com/TinySuiteHQ/TinySearch
기본 컨셉은 여전해:
TinySearch는 웹 검색하고, 읽을만한 페이지 긁어온 다음, 모델 컨텍스트 윈도우에 들어가기 전에 로컬에서 쓸만한 부분만 골라내는 가벼운 셀프 호스팅 MCP/FastAPI 툴이야.
중간에 LLM이 필터링이나 요약질 하는 거 없어. 그냥 BM25 + 로컬 ONNX 임베딩 조합이고, 반환되는 청크는 소스 URL이 붙은 원본 페이지 텍스트 그대로임.
난 여전히 작은 모델이나 로컬 모델 쓰는 상황을 염두에 두고 만들고 있어. 4B/9B 모델한테 웹페이지 5만 토큰씩 던져주고 알아서 중요한 문단 5개 찾으라고 하는 건 좀 아니잖아, 안 그래? ㅋㅋ
v0.6.1에서 가장 큰 변화는 CDP를 통한 '브라우저 직접 지정(bring-your-own-browser)' 지원이야.
원래 TinySearch는 자체 Chromium을 돌리는데, 이제는 네가 직접 쓰는 브라우저를 연결할 수 있어. 그러니까 이미 네 프로필, 프록시, 쿠키, 핑거프린팅 설정 다 되어 있는 브라우저가 있다면 TinySearch가 그걸 그대로 쓸 수 있다는 거지.
이거 덕분에 갓 만든 헤드리스 Chromium 세션을 싫어하는 사이트들 긁어올 때 훨씬 편해졌어.
0.4.0 이후로 바뀐 것들 몇 개 더 적어볼게:
-
search랑 scrape_urls가 이제 별도 툴로 분리됨. search는 의도적으로 가볍고 빠르게 만들어서 Chromium이나 임베딩 모델을 아예 안 띄워.
-
scrape_urls는 한 번에 URL 1~5개까지 받을 수 있고, 브라우저 하나로 동시에 크롤링함.
-
페이지마다 집중적인 질문을 던져서 관련 청크를 가져오거나 리랭킹할 수도 있고, 그냥 깔끔하게 정리된 페이지를 순서대로 가져올 수도 있어.
-
관련 링크도 같이 반환되는데, 네 쿼리에 맞춰서 랭킹이 매겨지니까 에이전트가 TinySearch가 멋대로 인터넷 절반을 다 긁어오게 두지 않고도 다음에 어디로 갈지 결정할 수 있음.
-
MCP 응답 형식이 이제 예전 텍스트 프롬프트 방식에서 XML로 바뀜.
-
마크다운 생성 전에 보일러플레이트 제거 작업이 먼저 들어감.
-
Docker, 보안, 테스트 쪽도 꽤 손봤어.
그리고 드디어 "토큰 아껴준다"고 말만 하는 게 아니라 재현 가능한 벤치마크도 추가했어. 연구용 쿼리 8개 돌려본 결과는 이래:
146,878 토큰 → 53,426 토큰
대충 웹 콘텐츠 64%를 덜어내고 모델 컨텍스트에 넣은 셈이지.
물론 이게 무조건 64% 보장한다는 건 아니고, 페이지마다 다르긴 해. 광고 덕지덕지 붙은 사이트는 80% 이상 줄어들고, 원래 깔끔한 페이지는 거의 변화 없더라. 벤치마크 스크립트는 레포에 있으니까 직접 돌려보거나 뜯어보고 싶은 사람은 확인해 봐.
내가 지금 쓰는 워크플로우는 대충 이래:
search → 모델이 쓸만한 URL 선택 → 해당 URL 스크랩 → 모델은 관련 증거만 전달받음
여전히 셀프 호스팅이고, MCP 클라이언트랑 잘 돌아가고, 유료 검색/스크래핑 API도 필요 없어.
특히 작은 로컬 모델 돌리거나 브라우저/검색 환경 직접 구축해서 쓰는 사람들 피드백이 궁금해. CDP/브라우저 방식으로도 여전히 잘 안 뚫리는 이상한 사이트 제보도 환영함.


