로컬 모델이 정확한 답변을 제공한다고 믿을 수 있을까?
Can you trust local models to answer accurately?
핵심 요약
로컬 LLM의 기술적 질문 답변 정확도를 RAG 시스템으로 검증한 결과, 지식 베이스와 결합했을 때 매우 뛰어난 성능을 보였습니다.
- RAG 시스템 성능 — 지식 베이스와 결합 시 로컬 LLM의 답변 정확도가 크게 향상됨
- 벤치마크 테스트 — 7,648개의 객관식 문제를 통해 모델별 성능을 정밀하게 측정함
- Apple Intelligence — 3B 파라미터 모델임에도 86%의 높은 정확도를 기록함
- 학습용 앱 개발 — 사용자가 직접 학습 콘텐츠를 생성할 수 있는 iOS 앱을 개발함
개발자로서 더 성장하고 싶어서 로컬 LLM이 기술적인 질문에 얼마나 정확하게 답할 수 있는지 테스트해 봤음.
결론부터 말하자면 RAG 없이는 성능이 영 별로인데, RAG 붙이니까 아주 쓸만함.
'Thinking' 기능은 별로 도움도 안 되는데 시간만 엄청 잡아먹어서 e2b랑 e4b 점수만 겨우 뽑았음. 나머지는 아직도 돌아가는 중인데, Thinking 켜봤자 점수 1% 오르는 게 전부더라.
내가 한 짓은 이거임:
- 리스트에 있는 프로젝트들(Node, Langchain.js, typescript, transformers.js, vue)의 깃허브 레포에서 마크다운 문서를 싹 다 긁어옴.
- deepseek-v4-flash 써서 각 마크다운 파일 기반으로 객관식 문제들을 만들었음.
- Thinking 기능을 끈 상태에서 unsloth gemma QAT 모델들로 이 문제들을 벤치마크함.
- Thinking 기능을 끈 상태에서 정답 문서가 포함된 상태로 unsloth gemma QAT 모델들을 벤치마크함 (oracle 컬럼).
- RAG 시스템을 구축해서 Thinking 기능을 끈 채로 모든 모델을 벤치마크함. 로컬 LLM한테 질문할 때마다 관련 문서 세트를 일일이 골라주기 귀찮아서, RAG 시스템은 특정 문서 세트에만 국한하지 않았음.
RAG 시스템이 제대로 작동해서 꽤 만족스러움. 이거 돌아가게 하려고 튜닝하느라 고생 좀 했거든.
세 줄 요약: 로컬 LLM은 지식 베이스랑 연결해서 RAG로 질문하기 전에 관련 문서 딱 넣어주면 꽤나 훌륭함.
이건 내 이전 실험의 후속 글임. 이번엔 애플 인텔리전스랑 Qwen 모델도 추가했음.
애플 인텔리전스 관련 참고사항: 컨텍스트 길이가 4k 정도밖에 안 됨. 다른 모델들은 32k로 줬는데 말이지. 오라클 문서 상당수가 4k 토큰이 넘어가고, RAG 컨텍스트 주입할 때 상위 5개 결과도 4k를 넘겨서, 애플 인텔리전스는 상위 3개 결과만 넣고 돌렸음.
그러니까 기기에 내장된 쪼끄만 LLM 치고 86%라는 점수는 꽤 대단한 거임.
수정: 참고로 테스트한 애플 인텔리전스는 기기 내장 AFM 2 3b 모델임. 지적해 준 u/mcqwerty197 고맙다.
수정: 이 수치들은 7,648개의 객관식 문제를 기반으로 함.
수정: 이게 뭐 하는 건지, 어떤 앱인지 궁금해하는 사람들 있어서 말하는데, 내가 공부하려고 만드는 앱임. 아이폰용 첫 버전은 앱스토어에 올라와 있고 https://apps.apple.com/us/app/chatwise-chat-learn/id6784626027 업데이트 버전이랑 맥 버전은 지금 애플 검수 중임.
맥 버전이랑 최신 아이폰 버전 둘 다 검수 끝나면 자세히 글 한번 쓸게.

