Qwen 계열 LLM이 현대 오디오 모델의 중추로 조용히 자리 잡고 있습니다; 100개 이상의 오디오 모델 아키텍처를 정리한 차트
Qwen-family LLMs are quietly becoming the backbone of modern audio models; One chart for the architectures of 100+ audio models
핵심 요약
Qwen 계열 LLM이 다양한 오디오 모델의 핵심 아키텍처로 급부상하며, 이를 시각화한 차트와 학습 리소스가 공유되었습니다.
- Qwen의 지배력 — 32개 오디오 모델 계열이 Qwen 아키텍처를 채택함.
- 다양한 활용성 — TTS, ASR, 음악 생성 등 여러 오디오 작업에 적용됨.
- 학습 리소스 — 100개 이상의 모델 아키텍처를 한눈에 보는 차트와 앱 제공.
- 로컬 실행 — audio.cpp를 통해 파이썬 스택 없이 로컬에서 모델 구동 가능.
audio.cpp에 있는 모든 모델이 공유하는 구성 요소들을 매핑해 봤거든. 근데 결과가 생각보다 훨씬 흥미롭네.
Qwen이 이 컬렉션에서 압도적으로 가장 흔한 언어 백본이 됐어. 무려 32개의 오디오 모델 제품군이 Qwen 계열 아키텍처를 쓰고 있고, 그중 20개는 아예 Qwen3 LLM을 박아 넣었더라고.
이제 단순히 TTS 수준이 아니야. Qwen 기반 모델들이 음성 합성, ASR/오디오 이해, 음악 생성, 음성 대 음성, 심지어 오디오/비디오 모델까지 전부 다 씹어 먹고 있어.
두 번째 차트인 'Task × Technology Matrix'를 보면 어떤 구성 요소가 어떤 유형의 오디오 모델을 돌리는지 한눈에 보일 거야.

