ComfyUI를 이용한 로컬 AI 웹캠 포털 개발 - 손동작으로 프레임 만들기 | 로컬 모델 | API 없음 [무료 및 오픈 소스]
I built a local AI webcam portal with ComfyUI - make the frame with your hands | Local Models | NO API [Free and Open Source]
핵심 요약
손동작으로 AI 변환 영역을 조절하는 로컬 기반의 오픈 소스 웹캠 포털 GesturePortal을 개발함.
- GesturePortal 개발 — 손동작으로 웹캠 화면 내 AI 변환 영역을 실시간 제어함.
- 로컬 환경 구동 — ComfyUI와 MediaPipe를 활용해 API 없이 로컬에서 모든 처리 수행.
- 기술적 구현 — 전체 화면을 스타일링한 후 손동작으로 마스크를 씌워 결과물을 노출함.
- 성능 테스트 — RTX 5070 Ti 환경에서 모델별로 초당 0.4~3.6회 수준의 AI 업데이트를 확인함.
GitHub: https://github.com/pixelsncodes/GesturePortal/
제스처로 제어하는 실시간 AI 카메라 GesturePortal을 만들고 있다. 손으로 L자 모양을 만들면 웹캠 화면 안에 창이 하나 뜨면서, 그 안쪽만 애니메이션 스타일로 변하는 방식이다. 손을 움직이면 창도 따라 움직이고, 제스처를 풀면 창이 닫힌다.
가장 크게 개선한 점은 모델로 보내는 데이터 방식이다. 처음에는 손으로 선택한 영역만 잘라서 보냈는데, 그러다 보니 화면이 움직일 때마다 모델의 컨텍스트가 계속 바뀌는 문제가 있었다. 이제는 전체 카메라 화면을 연속적으로 스타일링하고, 제스처로 실제 화면과 스타일링된 화면 사이의 마스크를 조절하는 방식으로 바꿨다.
작동 원리는 다음과 같다:
-
OpenCV로 웹캠 영상을 캡처하고, MediaPipe로 양손을 추적한다.
-
뷰어가 엄지와 검지 제스처를 인식하면 네 모서리를 부드럽게 다듬어 소프트 엣지 마스크를 만든다.
-
로컬 ComfyUI가 선택된 모델을 사용해 전체 화면을 변환한다.
-
뷰어가 원본 소스, 제스처, AI 결과물을 동일한 캡처 시점에 맞춰 프레임 안쪽의 스타일링된 픽셀을 보여준다.
현재 프리셋은 Portrait v2, 4단계 레퍼런스 에디팅을 적용한 FLUX.2 Klein 4B, 그리고 6단계의 가 있다. Qwen은 선택 사항이며 연구용 라이선스를 사용한다.

