M4 Max에서 오프라인으로 Qwen 3.5/3.6 회의 요약 생성하기 (Wi-Fi 끄고 시연)
Got local Qwen 3.5/3.6 generating meeting summaries entirely offline on an M4 Max. Demo with Wi-Fi off. This is the future.
핵심 요약
AI 회의 앱 Hedy가 로컬 LLM을 활용해 오프라인 환경에서 회의 요약 및 노트를 생성하는 기능을 공개함.
- 로컬 AI 구동 — Wi-Fi 연결 없이 M4 Max에서 Qwen 및 Gemma 모델을 활용해 회의 요약과 실시간 코칭을 수행함.
- 모델 자유도 — Hugging Face의 GGUF 모델을 직접 불러와 사용할 수 있어 번들 모델에 국한되지 않음.
- 하드웨어 가속 — Apple Silicon의 Metal과 Windows의 Vulkan을 지원하며, 메모리 사용량을 미리 확인해 OOM을 방지함.
- 오프라인 제약 — 모바일은 고사양 기기로 제한되며, 클라우드 대비 성능 차이가 있을 수 있음을 명시함.
저는 AI 회의 앱인 Hedy를 만든 창업자입니다. 저는 로컬 AI를 강력하게 지지하며, 이를 '소비자 친화적'으로 만들기 위해 노력해 왔습니다. Hedy의 음성 인식은 항상 온디바이스(whisper.cpp, 현재는 parakeet 포함)로 실행되었습니다. 이번에 새로 출시된 기능은 나머지 AI 파이프라인(요약, 상세 노트, 회의 대화, 실시간 코칭)도 llama.cpp를 사용하여 온디바이스로 실행할 수 있게 된 것입니다. Wi-Fi를 끄고 노트북 외부로 아무것도 나가지 않습니다. 위 영상에서 전체 흐름을 확인하실 수 있습니다.
몇 가지 기술적 세부 사항은 다음과 같습니다:
기본 지원 모델. Qwen 3.6, Qwen 3.5, Gemma 4 제품군을 지원합니다. 저사양의 2B 모델(최신 아이폰에서 작동)부터 대부분의 노트북에서 적절한 성능을 내는 9B Qwen 3.5, 그리고 더 많은 VRAM을 가진 사용자를 위한 최신 27B 및 35B Qwen 3.6까지 다양합니다. 모델별로 여러 양자화 수준을 제공합니다. 예를 들어 9B Qwen의 경우 메모리 여유 공간에 따라 Q4와 Q8 중 선택할 수 있습니다.
사용자 모델 불러오기(Bring your own model). Hugging Face에서 호환되는 GGUF 모델을 다운로드하여 Hedy에 로드할 수 있습니다. 제공된 목록에만 국한되지 않습니다. 이는 의도적인 결정입니다. 로컬 AI 분야는 빠르게 변화하며, 사용자가 우리가 번들 옵션을 업데이트할 때까지 기다리게 하고 싶지 않았기 때문입니다.
가속. Apple Silicon에서는 Metal, Windows GPU에서는 Vulkan을 사용하며, 필요시 CPU로 대체됩니다. Mac의 통합 메모리는 전체 시스템 RAM이 제약 조건이 됩니다. Windows는 VRAM 기반이며, 레이어가 CPU로 넘어갈 때 선택 도구가 이를 알려줍니다.
앱 내 적합성 확인. 모델을 다운로드하기 전에 선택 도구가 해당 모델이 사용자의 하드웨어에 적합한지, 빡빡한지, 혹은 맞지 않는지 알려줍니다. 또한 현재 메모리 사용량을 보여주어 여유 공간을 파악할 수 있게 합니다. 예고 없는 OOM(Out of Memory)은 발생하지 않습니다.
솔직한 트레이드오프:
- 클라우드는 여전히 많은 사용 사례에서 더 빠르고 품질이 높습니다. 로컬은 선택 사항입니다. 27B 이상의 파라미터 모델은 대략 저희 클라우드 모델과 비슷한 품질을 제공합니다.
- 클라우드로 자동 전환되지 않습니다. 로컬 실행이 실패하면 오류가 표시됩니다. 이는 의도적인 결정입니다.
- 모바일은 가장 작은 모델로 제한됩니다(iPhone 15 Pro 이상 및 M 시리즈 iPad). 구형 기기에서는 토글이 표시되지 않습니다.
- Android와 웹은 로드맵에 있지만 아직 준비되지 않았습니다. Android의 하드웨어 다양성이 너무 커서 현재로서는 일관된 경험을 제공하기 어렵습니다.
- 자동 제안 기능은 무겁습니다(회의 중 추론을 매우 자주 실행하기 때문). 앱에서 로컬 세션 중에는 이 기능을 비활성화하도록 안내합니다.
데모 관련: 영상은 Qwen 3.5 4B를 실행하는 M4 Max입니다(데모를 위해 속도를 우선시했습니다). 영상 속 요약은 약 10분 분량의 회의 녹취록을 처리하는 데 15초 정도 걸렸습니다. 모델 크기와 하드웨어에 따라 결과는 달라질 수 있습니다.


