의료용 ASR을 위해 Parakeet 0.6B를 파인튜닝했습니다 — 오픈 웨이트, 로컬 Mac/CUDA/CPU 지원
I fine-tuned Parakeet 0.6B for medical ASR — open weights, local Mac/CUDA/CPU
핵심 요약
환자 데이터 보호를 위해 로컬에서 구동 가능한 고성능 의료용 음성 인식 모델 'Omi Med STT v1'을 공개했습니다.
- 로컬 구동 — 환자 오디오를 외부로 보내지 않고 기기 내에서 즉시 전사함
- 성능 최적화 — 0.6B 모델임에도 대형 클라우드 모델과 경쟁 가능한 의료 전문 용어 인식률 확보
- 멀티 플랫폼 — MLX(Apple Silicon), NeMo(CUDA), GGUF(CPU) 백엔드 자동 지원
- 향후 계획 — 다국어 지원 및 스트리밍 버전 개발 예정
NVIDIA의 Parakeet TDT 0.6B v2를 의료용 음성 인식에 맞춰 파인튜닝했고, 그 결과물을 Omi Med STT v1(CC-BY-4.0)이라는 이름으로 공개한다.
밝히자면, 나는 Omi Health의 창립자고 이걸 직접 만들었다. 학습 데이터 구성, 벤치마크, 실패 사례, 양자화 등 궁금한 거 있으면 뭐든 물어봐라.
목표는 간단했다. 환자 음성 데이터가 기기 밖으로 나가지 않고도 클라우드 기반의 강력한 시스템만큼 성능을 내는 작고 가벼운 로컬 ASR 모델을 만드는 거였다.
Mac, Windows, Linux용 런타임도 준비했다. 설치 및 실행 방법은 다음과 같다.
pip install omi-med-stt
omi-med-stt consultation.wav
기기 환경에 맞춰 백엔드를 자동으로 선택한다(Apple Silicon은 MLX, CUDA는 NeMo, CPU는 GGUF/parakeet.cpp). 기본값은 q8이다. q4도 만들어서 벤치마크 돌려봤는데, 약물 이름 인식 정확도가 너무 떨어져서 배포 안 했다.
벤치마크: 의료용 오디오 1,513개 클립(7.18시간)을 따로 떼어놓고 테스트했다. 모든 모델에 동일한 오디오와 스코어러를 사용했고, 의료 기록 작성에서 가장 중요한 medical-WER(M-WER = 의료 용어에서 발생한 오류만 측정) 기준으로 순위를 매겼다. 속도는 RTFx(실시간 대비 배수)로 표기했다.
기타 오픈소스 / 로컬 모델과 비교:
| Model | M-WER | WER | Drug | RTFx |
|---|---|---|---|---|
| VibeVoice-ASR 9B | 1.78% | 11.10% | 1.36% | 11× |
| Omi Med STT v1 (0.6B) | 2.37% | 8.30% | 4.75% | 145× |
| Qwen3 ASR 1.7B | 3.13% | 10.72% | 6.11% | 81× |
| Qwen3 ASR 0.6B |

