로컬 모델들과 다양한 양자화/설정을 SWE-bench 검증 데이터셋 일부로 비교해 봄
I compared local models and different quants / config on a subset of swe-verified bench
핵심 요약
로컬 LLM 모델과 양자화 설정에 따른 성능을 SWE-bench 기반으로 비교 분석한 결과 공유.
- 벤치마크 분석 — SWE-bench 검증 데이터셋을 활용해 로컬 모델 및 양자화 설정별 성능 비교함.
- 데이터 시각화 — 모델별 튜닝 결과와 상세 벤치마크 데이터를 웹 페이지로 정리해 공유함.
- 방법론 논의 — 벤치마크 재현성과 양자화에 따른 성능 변화에 대해 기술적 토론이 이루어짐.
- 향후 계획 — 작성자가 휴가 후 추가 제안을 검토할 예정임.
많은 데이터를 수집했음. 여기서 직접 확인 가능
더 궁금한 사람들을 위해 추가 세부 정보는 여기에 있음.
그래프에서는 파인튜닝 모델들을 베이스 모델별로 묶었지만, 페이지에서 세부 내용을 확인할 수 있음.
이 페이지들을 생성하는 파이썬 코드는 당연히 'vibecoded'(대충 짠)임. 결과물이 꽤 괜찮고 나한테는 나름 유용함. 다른 사람한테도 유용할지도 모름.
몇 주간 휴가를 떠날 예정이지만, 제안 사항이 있다면 하나하나 검토하겠음.


