SlopTV: 유튜브 채팅 댓글로 생성되는 무한 AI 슬롭 라이브 스트리밍 (5090 2대, Minimax H3)
SlopTV: an infinite livestream of AI slop generated from youtube chat comments, Minimax H3 on 2x5090
핵심 요약
유튜브 채팅을 입력받아 AI가 실시간으로 영상을 생성하고 무한 재생하는 로컬 기반 스트리밍 프로젝트입니다.
- 실시간 생성 — 채팅 내용을 LLM이 영상 프롬프트로 변환 후 MiniMax H3로 렌더링함
- 로컬 인프라 — 5090 GPU 2대를 활용해 45초마다 새로운 영상을 생성함
- 무한 루프 — 채팅이 없어도 AI가 스스로 개념을 생성해 24시간 브레인로트를 송출함
- 기술적 도전 — 유튜브 gRPC API 활용 및 VRAM 오버플로우 해결을 위한 ComfyUI 최적화
SlopTV: 채팅창이 곧 프로그래밍이 되는 유튜브 라이브 스트림이다. 네가 "물속에서 레이브 파티하는 카피바라 DJ"라고 치면, LLM이 이걸 400단어짜리 구조화된 비디오 프롬프트로 뻥튀기하고, 내 5090 중 하나가 MiniMax H3로 15초짜리 영상을 뽑아낸 다음, 네가 채팅 친 바로 그 스트림에 송출한다. 그러고 나면 사람들이 그 클립에 댓글을 달고, 이 뱀이 자기 꼬리를 먹어 치우는 무한 루프가 계속되는 거지.
@levelsio의 infiniteslop에서 영감을 받았는데, 이건 완전히 로컬에서 돌아간다.
수치 좀 까보자면: H3 오픈 웨이트, 디스크 용량 66GB, int8로 가지치기한 디퓨전 모델(19.5GB)이랑 nvfp4 텍스트 인코더(14.6GB)가 있는데, 32GB 카드 하나에는 다 안 들어가서 ComfyUI의 VRAM 오프로드가 넘치는 데이터를 다 받아먹는 중이다.
GPU 하나당 클립 하나 뽑는 데 90초 정도 걸리니까, 45초마다 새로운 슬롭(slop)이 쏟아져 나온다. 영원히. 아무도 채팅 안 칠 때는 LLM이 알아서 컨셉을 지어내도록 설정해 놔서, 새벽 4시에도 GPU는 아무도 안 보는 뇌 녹는 영상을 계속 찍어내고 있다. 나 이거 전기세 진짜 내면서 돌리는 거다.
배운 점들:
-
H3는 352p에서 프롬프트를 제일 잘 알아먹는다. 진짜 352p 말하는 거다. 352x608로 렌더링해서 1080p로 업스케일링하는데, 결과물은 쓰레기 같다. 근데 이 쓰레기 같은 게 우리 브랜드다.
-
ComfyUI는 세 가지를 스텁(stub) 처리하고 서버인 척 구라를 치면 내 프로세스 안에 임베디드해서 돌릴 수 있다.
-
유튜브는 라이브 채팅용 gRPC 스트리밍 API가 있는데 아무도 안 쓴다. 왜냐? 프로토(proto)를 직접 컴파일해야 하는데, 얘네가 공개한 프로토는 컴파일조차 안 되거든. REST 대안은 채팅 좀 활발해지면 30분 만에 일일 할당량을 다 태워 먹는다.
-
작은 모델들은 예시를 그대로 베낀다. 내 시스템 프롬프트에 예시 하나 넣어놨더니 모델이 모든 결과물에 그 이미지를 떡칠해 놓더라. 지금은 개 훈련시키듯이 규칙이랑 자리표시자만 넣어놨다.
코드베이스(이것도 사실 슬롭임): https://github.com/shuttie/SlopTV


