Whisper-Large-v3와 Groq/DeepSeek 기반의 오픈소스 실시간 일본 애니메이션 자막 및 번역 엔진을 만들었습니다
I built an open-source real-time Japanese anime subtitle & translation engine powered by Whisper-Large-v3 + Groq / DeepSeek
핵심 요약
Whisper-Large-v3와 LLM을 활용해 애니메이션 특유의 뉘앙스와 문맥을 살린 실시간 자막 번역 엔진 'NihonSub' 개발.
- 기술 스택 — Whisper-Large-v3와 Groq/DeepSeek을 결합해 실시간 번역 구현함.
- 핵심 기능 — 애니메이션 특유의 경어와 생략된 주어를 문맥에 맞게 번역함.
- 파이프라인 — ffmpeg를 통한 오디오 분할과 LLM 기반의 문맥적 번역을 수행함.
- 오픈소스 프로젝트 — MIT 라이선스로 공개된 NihonSub 저장소를 통해 누구나 사용 가능함.

안녕 r/LocalLLaMA 형들,
나처럼 애니 좋아하는 사람들은 구글 번역기나 기본 DeepL 같은 기존 기계 번역기 돌릴 때마다 빡친 적 많지?
-
일본어 특유의 호칭, 문장 끝 조사(-tteba, -zo, -desu wa), 캐릭터 말투 같은 거 죄다 뭉개버림.
-
주어 생략(pro-drop)도 제대로 못 해서 문장마다 대명사 지 맘대로 번역함.
-
클라우드 음성 인식 API는 배경음악(OST)이나 효과음, 캐릭터 비명 소리 나오면 바로 맛탱이 감.
그래서 내가 직접 NihonSub를 만들었어. 일본어 영상 파일을 넣으면 문맥을 파악해서 이중 언어 자막으로 바꿔주는 오픈소스 툴이자 동기화 플레이어야.
🛠️ 아키텍처 & 파이프라인:
-
오디오 추출 & VAD 청킹:
ffmpeg의 무음 구간 감지 기능을 써서 단어 중간에 안 끊기게 자연스러운 대화 단위로 영상을 쪼갬. -
음성 인식(STT): OpenAI Whisper Large-v3를 Groq LPU에서 돌려서 거의 실시간으로 일본어 받아쓰기함.
-
문맥 기반 LLM 번역: **DeepSeek / LLaMA-3 (Groq나 OpenRouter 경유)**에 애니 특유의 뉘앙스, 호칭 유지, 캐릭터 말투 살리면서 힌디어랑 영어로 동시에 번역하게 프롬프트 박아넣음.
-
동기화 시네마 UI: 이중 자막, 타임스탬프 스크러빙, 재생 제어 기능이 포함된 커스텀 WebVTT 생성기 및 비디오 플레이어.
💡 왜 굳이 표준 NMT 안 쓰냐고?
LLM은 단순 사전 찾기랑 다르게 문맥이랑 말투를 파악해서 누가 누구한테 말하는 건지 기가 막히게 잡아내거든. 게다가 무료 티어 API(Groq + OpenRouter 무료 모델)를 쓰면 구독료 한 푼 안 내고도 파이프라인 전체를 돌릴 수 있음.
위에 데모 영상 한번 봐봐!
-
GitHub 저장소: https://github.com/Abhishantpadam/NihonSub
-
라이선스: MIT
이 파이프라인에 대한 형들 생각은 어때? 로컬 엣지 모델(Whisper.cpp나 로컬 Ollama 인스턴스 같은 거) 최적화 아이디어나 피드백 있으면 뭐든 환영이야!
