음악 제작을 위한 무한 원샷 생성 및 텍스트 프롬프트 기반 신디사이저 모델을 개발했습니다.
I trained an audio model that can generate infinite one-shots for music production and turn text prompts into fully playable synths. I'm not only releasing the model but I've also released a video on exactly how I did it (and the inferencing pipeline to let others make text based synths.)
핵심 요약
음색 제어가 가능한 오디오 모델 'Foundation-1'을 공개하며, 이를 활용한 신디사이저 제작 파이프라인과 튜토리얼을 공유했습니다.
- Foundation-1 모델 — 음색과 악기를 독립적으로 제어할 수 있는 오디오 생성 모델임
- 기술적 성과 — 여러 디퓨전 호출에 걸쳐 일관된 음색의 키베드를 생성함
- 오픈 소스 공개 — 추론 파이프라인과 인터페이스 코드를 깃허브에 공유함
- 음악적 활용 — 텍스트 프롬프트를 통해 자신만의 신디사이저 패치를 생성할 수 있음

(여기에 올려도 되는지 모르겠네. 오디오 모델이나 이미지/비디오 모델은 허용되는 것 같은데, 이건 좀 결이 달라서 말이야.)
그동안 개인적으로 오디오 연구를 좀 해왔거든. 이 작업의 궁극적인 목표는 AI가 단순히 악기뿐만 아니라 음색(timbre) 자체를 별도의 제어 가능한 요소로 인식하게 만드는 거였어.
그랜드 피아노를 예로 들면, 따뜻하고 거친 소리도 낼 수 있고 차갑고 쨍한 소리도 낼 수 있잖아? 그래도 결국 피아노는 피아노인 것처럼 말이야.
근데 기존 모델들 중에는 이런 수준의 제어가 가능한 게 없더라고. 그래서 그냥 내가 직접 모델을 학습시키기로 했지.
여러 번의 디퓨전 호출을 거쳐도 음색이 딱 고정되는 키베드(keybed)를 만드는 게 진짜 개빡셌는데, 결국 해냈다.
관심 있거나 재미로 보고 싶은 사람들을 위해 전체 과정을 여기 정리해 뒀어.

키베드가 실제로 어떻게 작동하는지 궁금한 사람들을 위해 더 긴 설명 영상도 준비했어.
https://x.com/RoyalCities/status/2097733712293109842?s=20
말 없이 시연만 하는 영상
https://x.com/RoyalCities/status/2097733715543609445?s=20
마지막으로 허깅페이스 페이지야.
https://huggingface.co/RoyalCities/Foundation-1
인터페이스와 관련된 추론 파이프라인에 대해서도 상세하게 적어놨으니까, 누구나 마음만 먹으면 자기만의 텍스트-투-신스(text-to-synths) 코드를 짜서 놀 수 있을 거야 :)


