OpenCode용 네이티브 로컬 음성 입력 도구를 만들고 있는데, 이거 유용한 아이디어일까 아니면 내가 OpenCode에 너무 집착하는 걸까? 😅
I’m building native local voice input for OpenCode — useful idea or am I just too obsessed with OpenCode? 😅
핵심 요약
OpenCode 전용 로컬 음성 입력 도구 개발에 대한 사용자들의 의견을 묻는 포스트입니다.
- 음성 입력 도구 — OpenCode 내에서 직접 작동하는 로컬 음성-텍스트 변환 도구 개발함.
- 개인정보 보호 — 클라우드 없이 로컬에서만 작동하는 프라이버시 중심 설계.
- 확장성 — Whisper 등 다양한 STT 모델을 지원하는 유연한 백엔드 지향.
- 사용자 피드백 — 모델 관리자, 플랫폼 우선순위, 음성 UX 등에 대한 의견 수렴 중.
OpenCode 안에서 훨씬 쾌적한 음성 워크플로우를 써보고 싶어서 OpenCode Voice라는 작은 툴을 하나 만들고 있어.
아이디어는 간단해. 포커스된 곳 어디든 텍스트를 때려 박는 범용 받아쓰기 앱을 쓰는 대신, OpenCode 내부에서 직접 음성 녹음이랑 변환이 이루어지게 만드는 거야. 당연히 해당 작업을 시작한 세션이나 창에 딱 붙어서 작동하게끔 말이지.
지금 목표는 이거야:
- 완전 로컬/오프라인 변환
- 개인정보 보호 최우선, 클라우드 연결 없음
- 다양한 음성 인식(STT) 엔진 및 모델군 지원
- 원하는 모델을 직접 선택 가능
- 나중에는 모델 다운로드, 감지, 전환, 삭제까지 가능한 로컬 모델 매니저 추가
- 이미 설치된 모델이 있다면 최대한 재사용
- 비동기식 변환 지원 (한쪽 OpenCode 세션에서 변환 돌리는 동안 다른 쪽에서 작업 가능)
- ChatGPT 스타일의 음성 UX: 취소, 정지 후 삽입, 또는 정지 후 전송
- 오픈 소스
이미 돌아가는 버전은 만들어 뒀고, 지금은 통합이랑 호환성 다듬는 중이야.
장기적으로는 Whisper 모델 하나만 하드코딩하는 게 아니라, STT 백엔드를 확장 가능하게 만들어서 Whisper, Parakeet, Qwen ASR 같은 다른 로컬 모델이나 제공자들을 쉽게 붙일 수 있게 할 생각이야.
근데 이거 다듬느라 시간 쏟기 전에...
너네 진짜 이런 거 쓸 생각 있어?
특히 이런 부분에 대해 피드백 좀 주면 진짜 고맙겠어:
- 어떤 STT 모델이나 백엔드를 제일 먼저 지원했으면 좋겠는지
- 로컬 모델 다운로더/매니저가 내장되어 있으면 좋을지
- macOS / Linux / Windows 중 우선순위
- 단축키나 음성 UX 관련 의견
- 그 외 OpenCode에 있었으면 하는 음성 관련 기능
반응 괜찮으면 GitHub에 올리고 오픈 소스로 제대로 개발해 볼 생각이야.


