코딩 한 줄 없이 오디오북 생성기를 만들었는데 사람들이 실제로 쓰고 있네요
I vibe-coded an audiobook generator and people are actually using it
핵심 요약
코딩 지식 없이 LLM만 활용해 오디오북 생성기를 개발한 경험과 그 과정에서 겪은 기술적 고민을 공유함.
- 개발 방식 — 코딩 없이 LLM 지시만으로 오디오북 생성기 개발함
- 기술적 난관 — 코드 작성보다 청크 전략 및 TTS 환각 처리 등 의사결정이 더 어려움
- 하드웨어 호환성 — GPU 환경에 따른 호환성 문제 해결에 많은 시간이 소요됨
- 유지보수 — LLM이 짠 코드의 변경 사항이 전체 시스템에 미치는 영향 관리의 어려움
이 프로젝트에서 코드를 단 한 줄도 직접 작성하지 않았습니다. 제 배경은 코드 작성보다는 소프트웨어 개발 '과정'에 더 가깝기 때문에, Qwen3-TTS가 출시되었을 때 LLM을 지시하는 것만으로 어디까지 갈 수 있을지 확인해 보기로 했습니다.
그 결과물이 바로 Alexandria Audiobook입니다. EPUB이나 텍스트 파일을 넣으면 전체 오디오북을 만들어 줍니다. 괜찮은 GPU가 있다면 로컬에서 실행할 수 있고, 없다면 Qwen DashScope API를 통해 실행할 수 있습니다.
https://github.com/Finrandojin/alexandria-audiobook
SAMPLE: https://vocaroo.com/1cG82gVS61hn
실제 서비스(단순 장난감이 아닌)를 '바이브 코딩'하면서 놀랐던 점:
-
어려운 부분은 코드가 아니라 의사결정이었습니다. 청크 전략, TTS 환각 처리 방법, 10시간짜리 생성 작업이 충돌로 날아가지 않게 하는 원자적 파일 쓰기 등이 문제였습니다.
-
하드웨어 호환성이 생각보다 시간을 많이 잡아먹습니다. 제 GitHub 이슈의 절반이 호환성 관련 문제입니다.
-
LLM이 코드를 짜게 하는 건 쉬운 부분입니다. 변경 사항으로 인해 아무것도 고장 나지 않게 하는 것이 진짜 도전입니다.
어느 정도 인기를 얻어 중국의 GitHub_Daily에도 소개되었고, ML 분야의 유명 인사들에게서 별도 몇 개 받았습니다. 무엇보다 더 많은 분이 사용해 보고 개선 방법이나 버그, 엣지 케이스를 알려주셨으면 합니다.


