iPod touch 4 사진으로 비전 모델을 밑바닥부터 학습시키기
Training a vision model from scratch on iPod touch 4 images
핵심 요약
iPod touch 4로 촬영한 350장의 사진을 활용해 DCGAN 비전 모델을 직접 학습시키는 실험을 진행 중임.
- DCGAN 학습 — iPod touch 4로 촬영한 사진 350장을 사용해 비전 모델을 밑바닥부터 학습함.
- 데이터 확장 계획 — 모델이 카메라 센서의 고유한 아티팩트를 포착할 수 있도록 총 5,000장까지 사진을 늘릴 예정임.
- 초기 결과 — 생성된 이미지가 2022년 당시의 DALL-E 결과물과 유사한 느낌을 준다고 함.
iPod touch 4로 찍은 사진들을 사용해 DCGAN 모델을 밑바닥부터 학습시켰습니다. 비전 모델을 처음부터 학습시키는 데 필요한 규모를 잘 알고 있기에, 우선은 사진을 찍을 대상 하나(컵)로 시작하고 있습니다. 다양한 배경과 조명 조건에서 빨간색 솔로 컵 사진을 약 350장 정도 촬영했습니다. 모델이 생성한 사진들을 보니 2022년 당시 OpenAI의 DALL-E가 떠오르네요. 총 5,000장 정도까지 찍어볼 생각인데, 모델이 iPod 카메라 특유의 센서 아티팩트를 잡아낼 수 있는지 확인해보고 싶습니다.


