교훈을 얻었다. 저장소를 맹목적으로 신뢰하지 말고, 장기(수주) 벤치마크를 돌릴 때는 모든 게 안정적인지 확인하자.
Lesson learned. Don't blindly trust repos and make sure everything is stable for a long running (multi weeks) benchmark.
핵심 요약
벤치마크 워크플로우의 불안정성을 발견하고 재평가를 진행한 결과, 모델 성능 지표에 유의미한 변화가 생겼습니다.
- 벤치마크 재평가 — 워크플로우 오류 수정 후 전체 모델 성능을 다시 측정함
- 모델 성능 변화 — Flash Next의 우위는 여전하나 추론 강도에 따른 차이가 명확해짐
- 장기 벤치마크 — 장기 실행 시 안정성 확보가 벤치마크 결과의 신뢰성에 필수적임
- 모델 추천 요청 — 커뮤니티에서 새로운 모델들에 대한 벤치마크 추가를 제안함
전에 swe-verified django 100 tasks benchmark 돌려서 로컬 모델이랑 양자화 비교한 거 올렸었지.
지금 새로 나온 모델은 없는데, 그동안 몇 주, 몇 달 동안 쓰면서 좀 불안정했던 평가 워크플로우를 싹 고쳤어. 그래서 전체적으로 다시 돌려봤는데 눈에 띄는 변화가 좀 있네:
-
Flash Next가 여전히 깡패긴 한데, 이제 xhigh랑 medium 추론 강도 차이가 제대로 드러나기 시작함.
-
3.8 27B도 마찬가지임 (근데 난 개인적으로 일상적인 작업할 땐 그냥 medium 쓰는 게 더 편하더라).


