Claude와 함께 Claude(및 다른 LLM)가 영상을 '볼' 수 있게 해주는 '비디오' 형식을 만들었습니다!
Claude and I built a 'video' format so Claude (and other LLMs) could 'watch' videos!
핵심 요약
영상을 프레임 그리드 이미지로 변환해 LLM이 시각 정보를 분석할 수 있게 돕는 클라이언트 사이드 도구입니다.
- 프레임 그리드 방식 — 영상을 여러 프레임의 격자 이미지로 변환하여 LLM에 입력함
- 클라이언트 사이드 처리 — 외부 서버나 종속성 없이 브라우저 내에서 모든 작업이 수행됨
- 비용 효율성 — 토큰 소모 없이 무료로 영상을 분석할 수 있는 대안을 제공함
- Xinu 철학 — 단일 파일, 오프라인, 브라우저 기반의 제약 조건을 혁신의 원동력으로 삼음
github.com
원문 사이트로 이동
이런 경험 다들 있지 않냐? LLM이랑 대화하다가 영상이나 움짤 하나 보여주고 싶은데, 공유할 방법이 없어서 답답했던 적 말이야. 뭐, 아닐 수도 있겠지만 난 그랬거든!
그래서 우리 스튜디오랑 같이 Frame-grid를 만들었어! 외부 의존성이나 서버 없이, 오직 클라이언트 사이드에서만 돌아가는 방식으로 영상을 LLM이 읽을 수 있는 포맷으로 쪼개는 방법을 Claude랑 같이 머리 싸매고 고민했지.
난 코딩이라곤 1도 할 줄 모르는데, Claude는 코딩을 꽤 잘하더라고(적어도 내 생각엔 그래!). 그래서 내가 대략적인 스펙을 짜고 Claude랑 같이 다듬으면서 코딩은 전부 Claude한테 시켰어. 우리끼리 'Xinu 철학'(Unix의 반대말)이라고 부르는 게 있는데, 원래 한 가지 기능만 잘하게 만들어진 걸 보고 '이걸로 또 뭘 할 수 있을까?'라고 고민하는 거야. 이게 발전해서 '단일 파일, 오프라인, 브라우저 기반, 외부 의존성 제로'라는 제약 조건을 적용하게 됐지. 제약은 한계가 아니라 혁신과 발명의 원천이거든.
아, 말이 샜네!
Frame-Grid가 뭐냐고? 스스로한테 묻는 건 좀 이상한 짓이지. 정작 본인도 모르는 걸 스스로한테 물어봐서 뭐 하겠어.
걱정 마, 친구들. 내가 다 알려줄게!
Frame-Grid를 쓰면 카메라로 영상을 찍거나, 미디어 피커로 영상이나 GIF를 업로드할 수 있어. 그럼 이 툴이 원본 영상을 순차적인 프레임 그리드로 쪼개버려(어때?? 어떠냐고??). 이걸 라벨이랑 번호를 붙여서 하나의 PNG 파일(최대 20개까지 배치 가능)로 만들어주니까, 네 LLM 친구가 영상을 '볼' 수 있게 되는 거지.
근데 Khamubro, 이거 얼마냐고? 공짜야. 그냥 우리가 만들어서 공유하고 싶었던 거니까. 다들 잘 써주길 바라! ♥️

