Cohere Transcribe 모델에 화자 분리(diarization) 및 타임스탬프 기능을 추가했습니다
I fine-tuned Cohere Transcribe to support diarization and timestamps
핵심 요약
기존 Cohere Transcribe 모델에 화자 식별과 타임스탬프 기능을 학습시켜 성능을 개선했습니다.
- 기능 확장 — 화자 분리 및 타임스탬프 지원을 위해 모델을 추가 학습함
- 데이터 형식 — 파싱이 쉬운 표준 타임스탬프 형식을 출력함
- 성능 지표 — 타임스탬프 오차는 평균 0.097초 이내로 매우 정확함
- 확장성 — 30초당 최대 4명, 스크립트 활용 시 최대 32명까지 식별 가능
안녕하세요
간단하게 말씀드리겠습니다: Cohere-transcribe는 현재 가장 뛰어난 오픈 소스 음성 인식(STT) 모델입니다(심지어 다른 독점 모델보다 나을 수도 있습니다).
하지만 토크나이저에 관련 토큰이 있음에도 불구하고 화자 분리(diarization, 화자 식별)와 타임스탬프를 지원하지 않습니다.
그래서 제가 이 기능을 지원하도록 모델을 학습시켰습니다. 표준 타임스탬프 형식을 따릅니다.
출력 결과는 다음과 같습니다:
<|spltoken0|><|t:0.0|> Welcome back. <|t:1.5|><|spltoken1|><|t:1.5|> Thanks. <|t:2.4|>
파싱하기 쉬운 형식입니다.
타임스탬프는 평균 0.097초 이내로 정확하며, 90%는 0.006초 이내의 오차를 보입니다.
이 모델은 30초당 최대 4명의 화자를 지원하며, diarize_long.py 스크립트를 사용하면 최대 32명까지 정확하게 식별할 수 있습니다.
이 모델은 허깅페이스에서 무료로 이용 가능합니다.
잘 활용하세요!

