16GB VRAM 환경에 맞춰 Gemma 2 12B를 툴 콜링 성능 2.7배 향상되도록 파인튜닝했습니다
I fine tuned Gemma 4 12B for a 2.7x improvement on tool calling because I can't fit anything else comfortably into my 16 GBs of Vram
핵심 요약
VRAM 제약이 있는 환경에서 Gemma 2 12B 모델을 툴 콜링과 CLI 작업에 최적화하여 성능을 개선했습니다.
- 모델 파인튜닝 — 툴 콜링 및 CLI 작업 효율을 높이기 위해 Gemma 2 12B 모델을 재학습함
- 성능 개선 — 툴 사용 빈도와 정확도가 크게 향상되어 에이전트 작업에 적합해짐
- 학습 데이터 — glaive-function-calling-v2와 AgentInstruct 데이터셋을 활용하여 5천 개 이상의 예제로 학습함
- 기술 스택 — QLoRA SFT 방식을 사용해 3 에포크 동안 학습을 진행함
huggingface.co
원문 사이트로 이동
Gemma 12B는 확실히 학습이 아주 잘 된 모델이긴 한데, 난 애초에 얘한테 적용된 파인튜닝이 에이전트형 코딩에는 영 안 맞는다고 생각했거든. 직접 써보니까 Github Copilot에서 제공하는 도구들도 제대로 못 쓰고, CLI 다루는 것도 진짜 젬병이더라고.
그래서 이참에 도구 호출이랑 커맨드 라인 쪽으로 파인튜닝을 해서 두 마리 토끼를 다 잡아보기로 했지. 결과는 대박이었어. 도구 활용 능력이 좋아진 건 물론이고, 모델이 도구 호출을 시도하는 횟수도 15.7%나 늘었거든. 추론하느라 헤매는 시간 줄이고 바로바로 일 시킬 수 있게 된 거라 아주 만족스러워.
fp16에서 Q4_K_M으로 변환한 가중치 올려놨으니까 llama.cpp나 ollama에서 바로 가져다 쓰면 돼.

