받아쓰기 교정용 0.8B 로컬 모델을 파인튜닝해봤음. 특정 작업에선 클라우드 모델이랑 비비더라
I fine-tuned a 0.8B local model for dictation cleanup. It matched a hosted frontier model on this narrow task
핵심 요약
받아쓰기 텍스트의 불필요한 수정 없이 교정만 수행하는 0.8B 경량 모델 'SpeakoFlow Mini' 개발 및 성능 공유.
- 모델 성능 — 0.8B 모델로 특정 작업에서 대형 모델과 대등한 성능 달성함.
- 교정 방식 — 받아쓰기 시 불필요한 문장 개선을 배제하고 실제 수정 사항만 반영함.
- 기술 사양 — Qwen3.5-0.8B 기반 파인튜닝으로 833MB 용량의 오프라인 구동 지원함.
- 데이터셋 — 실제 받아쓰기 데이터 3,189쌍을 활용해 학습됨.
받아쓰기 내용 다듬는 용도로 Qwen3.5-0.8B를 Apache-2.0으로 파인튜닝해서 SpeakoFlow Mini를 만들었음.
이건 챗봇도 아니고 그냥 글 다듬는 모델도 아님. 음성 인식(STT) 결과물을 받아서 화자가 실제로 수정한 부분만 딱 고치고 나머지는 건드리지 않게 만들었음. 마지막 부분이 말은 쉬워 보여도 실제론 꽤 까다로움. 보통 모델들은 멀쩡한 문장까지 굳이 고치려 드는데, 받아쓰기에서는 불필요한 수정도 결국 오답이거든.
예를 들면 이런 식임:
Input: The deadline is Monday. Scratch that. The deadline is Wednesday.
Output: The deadline is Wednesday.
내가 만든 영어 전용 벤치마크에서 SpeakoFlow Mini는 70.7%, GPT-5.6 Luna는 65.0%를 찍었음. 둘 다 추론 기능 끄고 똑같은 짧은 프롬프트 고정해서 돌린 결과임. 5.8점 차이가 나긴 하는데 95% 신뢰 구간이 [-1.5, +12.9]라 사실상 통계적으로는 비긴 거나 다름없음.
이 세팅이 중요한 게, 이 모델은 애초에 이런 저사양 환경에 맞춰서 학습됐거든. 프롬프트 길게 늘리고 추론까지 시키면 Luna가 훨씬 잘함. 여기 나온 좁은 범위 말고 특이한 케이스 처리할 때도 Luna가 더 낫고.
내가 주장하는 건 딱 하나임. 추론 없이 짧은 프롬프트 하나만 딱 던졌을 때, 0.8B짜리 로컬 모델이 이 작업만큼은 최상급 클라우드 모델이랑 비비는 수준까지 왔다는 거임.
튜닝 안 된 순정 Qwen3.5-0.8B랑 비교해보면 확실함. 파인튜닝 전에는 47.3%였는데 70.7%까지 올랐음. 23.4점 상승했고 95% 신뢰 구간은 [+16.3, +30.3]임. 두 번째 사진 보면 비교 결과 나와 있음.
Q8_0 빌드는 833MB고 완전 오프라인으로 돌아감. 허깅페이스 페이지에 모델 파일, 실행 명령어, 벤치마크 방식, 양자화 결과, 한계점, 공개 예시 다 올려놨음:
https://huggingface.co/SpeakoFlow/speakoflow-mini
평가 데이터셋은 따로 공개 안 함.
써보고 나서, 혹시라도 건드리지 말아야 할 걸 굳이 수정해버리는 케이스 있으면 꼭 좀 알려주라. 그게 제일 궁금함.
참고: SpeakoFlow Mini랑 SpeakoFlow는 내가 직접 만든 거임.


