단 3달러의 API 비용과 사람의 개입 없이 Claude Haiku 성능의 96%를 달성한 Qwen2.5-7B 파인튜닝
Fine-tuned Qwen2.5-7B to 96% of Claude Haiku on a domain-specific task using ~$3 of API calls and zero human labelers
핵심 요약
합성 데이터와 DPO를 활용해 도메인 특화 작업에서 Claude Haiku급 성능을 저비용으로 구현한 파인튜닝 파이프라인 사례입니다.
- DV-DPO 방법론 — 적대적 압박을 통한 수정 사항만 학습 데이터로 활용함
- 비용 효율성 — 3달러 수준의 API 호출로 Claude Haiku 성능의 96% 달성
- 자동화 루프 — 실패 탐지부터 재학습까지 이어지는 자율 파이프라인 구축
- 모델 선택 — 구조화된 데이터 처리에 강점이 있는 Qwen 2.5 모델 활용
결정-추론 엔진(Orlog)을 만들었는데, 호출할 때마다 비용을 내는 대신 로컬 모델을 파인튜닝하고 싶었습니다.
방법론 (DV-DPO):
- 각 질문에 대해 3개의 보이스(모델)로 토론을 실행하고 종합 결과를 생성함
- 교차 검증: 패배한 보이스들이 종합 결과에 이의를 제기함
- 종합 결과가 수정되면 → DPO 페어 생성 (chosen=수정 후, rejected=수정 전)
- 종합 결과가 유지되면 → 페어 생성 안 함 (좋은 추론은 학습할 거리가 없기 때문)
적대적 압박 하에서 진짜로 수정된 경우에만 학습 신호가 됩니다. 형식 선호도나 샘플링 변동성은 학습하지 않습니다.
결과:
- 총 1,040개 페어 (Haiku 요금 기준 약 3달러)
- Claude Haiku와 1:1 비교: 형식 100%, 커밋 100%, 문맥 89%, 종합 96%
- 지연 시간: 11초 vs 3초 (T4 GPU, 4비트 양자화)
- 적대적 실패율: 96개의 타겟 질문 중 2%
현재 자율 루프 가동 중:
failure_detector → auto_red_team → DPO pairs → retrain → redeploy → eval. v5 페어 축적 중.
Ollama용 GGUF 준비 완료. 관심 있다면 파이프라인을 공유하겠습니다.

