직접 만든 에이전트 기반 텍스트-SQL 벤치마크로 소형 로컬 모델과 OpenRouter 모델들을 테스트해 봤습니다. 의외의 결과가 나왔네요...
I tested as many of the small local and OpenRouter models I could with my own agentic text-to-SQL benchmark. Surprises ensured...
핵심 요약
직접 개발한 텍스트-SQL 벤치마크를 통해 다양한 소형 로컬 모델의 성능을 비교하고 결과를 공유했습니다.
- 벤치마크 도구 — 25개의 SQL 질문으로 구성된 빠르고 효율적인 에이전트 성능 평가 도구입니다.
- 모델 성능 — Kimi-k2.5, Qwen 3.5 27B/397B 모델이 최상위권 성능을 기록했습니다.
- 로컬 실행 — WASM 버전 Llama.cpp를 통해 사용자가 직접 자신의 서버에서 벤치마크를 실행할 수 있습니다.
- 향후 계획 — 브라우저에서 구동 가능한 0.8B급 SQL 특화 모델 파인튜닝을 목표로 하고 있습니다.
지난주에 어떤 모델을 추가로 테스트하면 좋을지 피드백을 요청했었죠. 전부 추가했고 이제 벤치마크를 https://sql-benchmark.nicklothian.com/에서 확인하실 수 있습니다.
당시 에이전트가 정확히 무엇을 하는지 자세히 설명하지 않았는데, 간단히 말해 "각 제품 하위 카테고리별 주문 라인, 매출, 판매 단위, 단위당 매출(총 매출 ÷ 총 판매 단위), 하위 카테고리 내 제품당 평균 정가, 총 이익 및 이익률을 보여줘"와 같은 영어 쿼리를 입력받아 데이터베이스 테이블을 대상으로 테스트할 SQL로 변환합니다.
에이전트는 쿼리 결과를 확인하고 문제를 수정할 수 있지만, 디버깅 횟수에는 제한이 있습니다.
벤치마크는 의도적으로 짧게(25개 질문) 구성했고 실행 속도도 빨라서(대부분 모델에서 5분 미만) 다양한 설정을 테스트해 보기 좋지만, 최고의 모델과 나머지를 구분할 수 있을 만큼 충분히 까다롭습니다.
(WASM 버전 Llama.cpp 덕분에) 자신의 서버에서 직접 실행할 수 있는 기능도 추가했습니다.
흥미로웠던 점 몇 가지:
- 최고의 오픈 모델은 kimi-k2.5, Qwen 3.5 397B-A17B, 그리고 Qwen 3.5 27B (!)입니다.
- NVIDIA Nemotron-Cascade-2-30B-A3B가 Qwen 3.5-35B-A3B보다 높은 점수를 기록했고 Codex 5.3과 대등합니다.
- Mimo v2 Flash는 정말 보석 같은 모델입니다.
여러분들이 어떤 점수를 받는지, 그리고 v2를 위해 무엇을 바꿔야 할지 의견을 듣고 싶습니다!

