드디어 해냈다: Qwen3.6-27B + 에이전트 검색으로 단일 3090에서 95.7% SimpleQA 달성
We are finally there: Qwen3.6-27B + agentic search; 95.7% SimpleQA on a single 3090, fully local
핵심 요약
단일 RTX 3090 환경에서 Qwen3.6-27B와 LDR을 활용해 로컬 환경에서 95.7%의 SimpleQA 정확도를 달성함.
- 로컬 에이전트 성능 — 단일 RTX 3090에서 Qwen3.6-27B 모델을 활용해 95.7%의 SimpleQA 정확도를 기록함.
- 기술적 구현 — Langgraph 에이전트 전략과 도구 호출을 통해 복잡한 검색 및 추론 작업을 수행함.
- 개인정보 보호 — 사용자 데이터 암호화 및 제로 텔레메트리 정책을 적용하여 보안성을 강화함.
- 오픈 소스 도구 — 학술적 소스 등급 평가 시스템을 포함한 MIT 라이선스 기반의 로컬 딥 리서치 도구임.
LDR 메인테이너입니다. r/LocalLLaMA 커뮤니티의 강력한 지원 덕분에 LDR이 여기까지 올 수 있었습니다. 로컬 LLM 연구의 주요 채널 중 하나에 다시 글을 올릴 준비가 되지 않았다고 생각해서 한동안 소식을 전하지 않았습니다.
하지만 LDR 커뮤니티가 드디어 다시 그 수준에 도달했다고 생각합니다. 이제 다시 소식을 전할 때가 된 것 같습니다.
Setup
- RTX 3090, 24GB
- Ollama backend (qwen3.6:27b)
- LDR's
langgraph_agentstrategy — LangChaincreate_agent()with tool-calling, parallel subtopic decomposition, up to 50 iterations - LLM grader: qwen3.6:27b self-graded (I have used opus to review examples and it generally only underestimates accuracy)
Benchmarks (fully local LLM with web search)
|Model|SimpleQA|xbench-DeepSearch|
|:-|:-|:-|
|Qwen3.6-27B|95.7% (287/300)|77.0% (77/100)|
|**Qwen3.5-9B**|91.2% (182/200)|59.0% (59/100)|
|gpt-oss-20B|85.4% (295/346)|–|
샘플 크기는 작지만, 벤치마크를 여러 번 다시 실행하지 않았고 다른 행들을 보면 이것이 단순히 우연이 아님을 알 수 있습니다. 전체 리더보드: https://huggingface.co/datasets/local-deep-research/ldr-benchmarks
Important framing — these are agent + search scores, not closed-book
하지만 이 결과는 Perplexity Deep Research(93.9%), tavily(93.3%) 등과 유사한 벤치마크 결과라는 점을 참고해 주세요. [Tavily는 LLM이 검색된 문서에서만 답변하도록 강제합니다(순수 검색 테스트). Perplexity Deep Research는 엔드투엔드 에이전트이며 그레이더나 샘플 크기를 공개하지 않습니다.]
결과가 90%만 되었더라도 이미 큰 성공이었을 것입니다.
또한 일상적인 질문에 대해 무작위로 쿼리를 날려본 결과, 이 수치들이 제 체감 성능과 일치한다는 것을 확인할 수 있었습니다.
Caveats:
- SimpleQA 오염 위험이 최신 베이스 모델에서 실재함
- LLM-judge 노이즈 + 샘플링 오류
- bench-DeepSearch는 중국어 기반이므로 중국 모델인 Qwen에 유리함
- 아직 BrowseComp / GAIA 수치는 없음 - 하지만 우리가 아직 이 벤치마크를 잘 수행한다고 생각하지 않음. 현재 상태를 검증하기 위해 몇 가지 벤치마크를 실행해 볼 예정임
놀라웠던 점:
결과는 로컬 딥 리서치에서 모델의 크기보다 도구 호출(tool-calling) 품질을 더 많이 따라가는 것으로 보입니다. langgraph_agent 전략은 모델에 다중 반복 도구 호출, 병렬 하위 에이전트 분해, 구조화된 출력을 쏟아붓는데, 이는 최신 Qwen 세대가 가장 많이 개선된 부분이기도 합니다. 가설일 뿐이며, 누군가 어블레이션(ablation)을 설계하고 싶다면 데이터를 환영합니다.

