카피라이팅 및 창의적 글쓰기 작업을 위해 특별히 파인튜닝된 Gemma-4-31B (EqBench3 기준 베이스 모델 대비 Elo +290점)
Fine-tuned Gemma-4-31B specifically for Copywriting & Creative Writing Tasks (Scored +290 Elo over base using EqBench3)
핵심 요약
카피라이팅 성능을 극대화하기 위해 Gemma-4-31B를 파인튜닝한 모델이 공개되었습니다.
- 모델 파인튜닝 — 마케팅 카피라이팅에 최적화된 Gemma-4-31B 모델 개발
- 성능 평가 — EQ-Bench 3 기반 벤치마크에서 베이스 모델 대비 Elo 290점 향상
- 학습 데이터 — 직접 구축한 마케팅 데이터셋과 합성 데이터를 활용한 QLoRA SFT
- 사용 팁 — 최상의 결과물을 위해 Gemma 4의 추론 모드(reasoning mode) 비활성화 권장
안녕 r/LocalLLaMA 형들,
내가 작업 중인 좁은 범위의 파인튜닝 모델 하나 공유하고, 비슷한 도메인 특화 작업 해본 형들한테 기술적인 피드백 좀 받고 싶어서 글 써.
문제점: 일반적인 챗봇 모델들은 마케팅 문구는 잘 쓰는데, 맨날 똑같은 버릇이 나와. "오늘날처럼 빠르게 변화하는 세상에서..." 같은 뻔한 도입부나, 구체적인 내용은 없고 두루뭉술하게 장점만 늘어놓는 거 말이야. Claude가 잘하는 건 인정하는데, 나도 내 거 하나 만들어보고 싶었거든. 그래서 Gemma-4-31B-it을 파인튜닝해서 그런 군더더기 싹 빼고, 다이렉트 리스폰스 카피라이터처럼 바로 고통을 찌르고, 구체적이고, CTA(행동 유도)가 확실하게 박히도록 만들었어. 전반적으로 모델의 감성 지능도 더 올라갔더라.
평가 방식: EQ-Bench 3 방법론(페어와이즈 Elo + 루브릭)을 기반으로 카피라이팅 전용 벤치마크를 직접 만들었어. 페이스북 광고, 콜드 이메일, 랜딩 페이지, 제품 설명, SMS, 스크립트 등 실제 사례 30개를 가져왔지. 베이스 모델이랑 파인튜닝 모델 둘 다 똑같은 과제를 수행하게 했고, 위치 편향을 막으려고 DeepSeek V4 Flash가 순서를 바꿔가며(A-vs-B, B-vs-A) 블라인드 테스트로 채점했어. 베이스 가중치랑 디코딩 설정은 똑같이 맞췄고, 파인튜닝 여부만 변수로 뒀어.
결과:
| Model | Elo Score | Head-to-head |
|---|---|---|
| Fine-tuned | 1657 | wins 24/30 (80%) |
| Gemma-4-31B-it (base) | 1367 | — |
가장 크고 일관된 성과는 후킹 강도, 구체성, 간결함에서 나왔어. 딱 다이렉트 리스폰스 카피가 중요하게 생각하는 부분들이지.
학습 세부 사항: 실제 광고 예시를 포함해서 마케팅 브리프와 그에 대한 완성본으로 구성된 큐레이션 데이터셋으로 QLoRA SFT를 돌렸어. 최종 가중치는 풀 bf16으로 병합했어(어댑터 따로 안 씀). 256K 컨텍스트 지원하고, vLLM이나 Transformers에 바로 넣어서 쓰면 돼.
최상의 결과를 얻으려면 enable_thinking=false로 설정해야 해. Gemma 4의 추론 모드를 켜면 오히려 결과물 퀄리티가 떨어지니까 이 점 꼭 참고해 줘.
모델 카드 + 가중치: https://huggingface.co/akwin123/copywriter-gemma4-31b
양자화 버전:
https://huggingface.co/models?other=base_model:quantized:akwin123/copywriter-gemma4-31b
써보고 성능 어떤지 좀 알려줘. 고마워!
