Parakeet 기반의 새로운 ASR 모델, Orukeet
Orukeet, new ASR model based on Parakeet
핵심 요약
NVIDIA Parakeet을 개선하여 25개 언어에서 성능을 높인 새로운 ASR 모델 Orukeet이 공개되었습니다.
- 모델 성능 향상 — 기존 Parakeet 대비 74개 테스트 중 61개에서 더 나은 WER 기록함
- 기술적 특징 — 인코더 필터 일부를 12,288개의 고정된 Gabor 커널로 대체함
- 다국어 지원 — 25개 언어 및 다중 억양 데이터로 학습되어 범용성 확보함
- 경량화 모델 — Qwen ASR 등 경쟁 모델 대비 작은 크기로 빠른 속도 기대됨
huggingface.co
원문 사이트로 이동
아직 아무도 언급 안 한 거 같아서 글 하나 싸본다. OpenWhispr 써보다가 추천 모델로 뜨길래 발견했음. 나도 아직 직접 써보진 않았는데, Parakeet보다 성능 좋고 특히 맥에서 잘 돌아간다는 듯.
공식 설명은 대충 이렇다:
"Orukeet은 NVIDIA Parakeet TDT 0.6B v3를 기반으로 만든 25개 언어 지원 음성 인식 모델이다. 인코더의 시간적 깊이별 필터 절반을 12,288개의 고정된 Gabor 커널로 교체했고, 나머지 파라미터는 다국어 및 다중 억양 데이터로 학습시켰다."
Orukeet은 74개 테스트 분할 중 61개에서 Parakeet보다 성능이 잘 나오는데, LibriSpeech test-clean(1.46% vs. 1.53% WER), test-other(2.86% vs. 3.14%), 그리고 FLEURS 영어(3.82% vs. 4.28%)가 포함됨. FLEURS 25개 언어 전체 통합 WER은 **9.85% vs. 11.01%**로, 10.6% 상대적 감소를 보여줌. 최종 적응 및 체크포인트 선택은 LibriSpeech test-other를 사용했음.

