LAION, 1,000만 시간 분량의 오픈 비디오 데이터셋 'LAION-BVD' 공개
Laion Big Video Dataset
LAION이 멀티모달 학습을 위한 대규모 오픈 비디오 데이터셋 'LAION-BVD'를 공개했다. CommonCrawl에서 수집한 13억 개의 비디오 URL 중 8,000만 개를 다운로드해 총 1,000만 시간 분량의 비디오를 확보했다. 콘텐츠 인식 장면 감지를 통해 클립을 추출하고, 합성 비디오 및 오디오 캡션을 생성했다. 이 데이터로 학습한 모델은 비디오-텍스트, 오디오-텍스트, 이미지-텍스트 벤치마크에서 경쟁력 있는 성능을 보였으며, 특히 ViCLIP 모델은 InternVid 기반 모델 대비 최대 2.1% 향상된 성능을 기록했다. 또한 비디오 프레임은 기존 웹 이미지 코퍼스와 다른 시각적 분포를 보여 이미지-텍스트 사전 학습에 효과적임을 확인했다. LAION-BVD는 연구 목적으로만 공개되며, 상업적 사용은 금지된다.
대규모 비디오 데이터셋과 이를 기반으로 학습된 모델은 소수의 독점 기술 기업에 집중되어 독립적인 과학적 조사와 재현성을 제한하고 있습니다.
HN 토론
16- voidUpdate
젠장, 그 많은 비디오에 대해 제작자들에게 연락해서 머신러닝 학습 콘텐츠로 사용 허가를 받기에는 정말 많은 양이네요. 물론, 그들이 허가를 받지 않고 그냥 진행했을 수도 있겠지만...
- vivzkestrel
- 전문가가 이 작업에 관련된 아키텍처에 대해 개요를 설명해 줄 수 있나요?
- 파이썬 aiohttp 안에서 yt-dlp를 실행한다고 가정해 봅시다.
- 분명 IP 주소가 플래그될 것이므로 곧 한도에 도달할 것입니다.
- 파이썬에서 프록시를 자동으로 순환시키는 솔루션은 무엇이 있나요?
- IP 주소가 차단되지 않고 1억 개의 비디오를 다운로드하는 더 좋고, 빠르며, 더 신뢰할 수 있는 방법이 있나요?
- topwalktown
"전체적으로 1억 3천만 개의 비디오를 다운로드하려 시도했고, 링크 성공률은 약 60%로, 총 1천만 시간 분량의 8천만 개의 비디오를 성공적으로 확보했습니다."
성공률이 그렇게 높다는 것에 놀랐습니다. 어떻게 유튜브가 그들을 차단하지 않았는지 모르겠네요. 하지만 이 URL 목록은 오래 가지 못할 것 같습니다. 유튜브가 이러한 비디오를 직접 다운로드하려는 연구자를 곧 차단할 것이기 때문입니다.