RAG 작업 시 MoE 대신 Dense 모델을 써야 할 이유가 있을까?
Any reason to run dense over MOE for RAGs?
핵심 요약
RAG 시스템 구축 시 Dense 모델과 MoE 모델 중 어떤 것이 더 나은 성능을 보이는지 경험을 공유하고 의견을 묻는 글.
- RAG 성능 비교 — Dense 모델과 MoE 모델 간의 정보 검색 및 합성 능력 차이를 논의함.
- 모델 안정성 논란 — MoE 모델이 문맥을 놓치거나 일관성이 떨어질 수 있다는 우려가 제기됨.
- 실제 테스트 중요성 — 개인의 사용 환경과 데이터셋에 따라 모델 성능이 달라질 수 있음을 강조함.
- 속도와 정확도 — MoE의 빠른 추론 속도와 Dense 모델의 정보 처리 깊이 사이의 트레이드오프를 다룸.
Claude를 연구용으로 많이 쓰는데, 모델 내부의 정보나 오정보에 대한 우려가 커서 직접 RAG 시스템을 구축 중임. 위키피디아, 논문, 책 등 대규모 데이터셋을 활용해 주장 및 논거 추출 작업을 진행하고 있음.
그동안 이 커뮤니티 분위기 때문에 MoE는 별로고 27b Dense가 최고라고 생각해서 Qwen 3.6 27b MTP를 썼음. 근데 테스트해보니 Qwen 3.6 35b APEX가 정보를 훨씬 더 잘 찾아내고 포인트도 많이 짚어줌. Dense는 상대가 안 됨. 3090 한 장으로 150 tok/s가 나오니 60 tok/s보다 훨씬 좋음.
다들 코딩 모델에 관심이 많지만, RAG에 한해서 MoE가 Dense보다 나은 점이 있는지 궁금함. 요즘 RAG 쓰는 사람이 있긴 한 건지, 봇이 아닌 사람이 쓴 정보 찾기가 너무 힘듦.

