모델 선택에 대한 나만의 경험칙
My RULE of Thumb of choosing a models
핵심 요약
LLM을 활용해 코딩 생산성을 높이는 모델 선택 기준과 속도에 대한 개인적인 경험 공유.
- 모델 선택 기준 — 코딩 작업 시 생산성 향상을 위한 모델별 용도 구분
- 속도와 품질 — 낮은 토큰 속도를 감수하고 고품질 분석을 수행하는 전략
- 모델 추천 — Qwen 시리즈와 DeepSeek Flash 등 작업별 선호 모델 공유
- 하드웨어 제약 — GPU 사양에 따른 모델 최적화 및 양자화 활용
이건 그냥 기대치 설정용으로 하는 말인데, 개인적으로 LLM 없이 기능 하나 구현하거나 디버깅하려면 3일(순수 코딩 시간 15시간)은 잡아야 했거든. 근데 Qwen 27B(Qwen 3.8 나오기 전에도) 쓰니까 4시간 컷이더라.
그리고 0.5 tok/s 속도가 사람 속도인 거 맞음. 수정하고 멍 때리는 시간 빼면 말이지. 내가 밤새도록 코드 베이스 전체 분석 돌리거나 핀테크, 심층 리서치 맡겨놓고 자도 괜찮은 이유가 바로 이거임.


