약속대로 100% 로컬 음성 대화 어시스턴트 깃허브 링크 공유함
As promised, here is the GitHub link for my 100% local voice-to-voice assistant
핵심 요약
로컬 환경에서 완전히 독립적으로 작동하는 음성 대화형 AI 어시스턴트 'Athena'의 깃허브 저장소가 공개됨.
- Athena 어시스턴트 — 로컬 하드웨어에서 구동되는 프라이버시 중심의 음성 대화형 AI임.
- 기술 스택 — Qwen3.5-397B, Orpheus 3B, Whisper-small.en 등을 C++ 파이프라인으로 통합함.
- 주요 기능 — 감정 표현, 장기 기억 유지, 문맥 이해 및 실시간 대화 중단 기능 제공.
- 하드웨어 요구사항 — 클라우드나 API 없이 단일 소비자용 GPU와 시스템 RAM으로 구동됨.
이 프로젝트의 초기 버전을 올리면서 깃허브 링크를 약속했었는데, 로컬 시스템에서 코드를 올릴 시간이 없었네요. 다들 미안해요, 사는 게 너무 바빠서요 :P
어쨌든, 더 지체하지 않고 바로 공개합니다:
깃허브: https://github.com/igorbarshteyn/athena
Athena는 로컬 하드웨어에서 완전히 오프라인으로 작동하는 프라이버시 중심의 음성 어시스턴트입니다. Athena는 대규모 MoE(Mixture-of-Experts) 언어 모델(Qwen3.5-397B), 신경망 TTS(Orpheus 3B), 실시간 음성 인식(Whisper-small.en), SNAC 신경망 오디오 코덱을 4단계 파이프라인으로 결합했습니다. 런타임에는 파이썬을 전혀 사용하지 않는 C++ 기반이며, 설정 시 일회성 오프라인 emotion2vec+ 모델 변환을 위한 선택적 파이썬 스크립트 하나만 존재합니다.
Athena는 자연스러운 감정(웃음, 한숨, 헐떡임)을 담아 말하고, 사용자의 목소리에 담긴 기본적인 감정을 읽어 반응하며, 세션 간 기억을 유지합니다(대화 사이에 지속되는 진화하는 장기 기억과 성격 포함). 긴 대화 문맥을 유지하고, 문장 중간에 말을 끊을 수 있으며(사용자가 말을 가로채면 멈추고 이미 말한 내용을 문맥으로 유지함), 단일 소비자용 GPU와 시스템 RAM에서 구동됩니다. 클라우드, 텔레메트리, API 키는 전혀 없습니다.
현재 이 시스템은 친구처럼 행동하고 유대감을 형성하도록 튜닝되어 있습니다. 이러한 매개변수는 코드에 내장된 시스템 프롬프트를 통해 취향에 맞게 조정할 수 있습니다.
다음은 이러한 기능을 보여주는 두 개의 세션 데모 영상입니다:




