LAION выпустила открытый видеодатасет на 10 миллионов часов
Laion Big Video Dataset
Команда LAION представила LAION-BVD — крупнейший открытый видеодатасет для мультимодального обучения. Он содержит 1,3 млрд URL-адресов видео из CommonCrawl, из которых скачано 80 миллионов роликов общей длительностью 10 миллионов часов. На основе контент-анализа выделены клипы с синтетическими видео- и аудиоописаниями. Модели, обученные на этих данных, показывают конкурентоспособные результаты на бенчмарках видео-текст, аудио-текст и изображение-текст, при этом кадры из видео дополняют стандартные веб-корпусы изображений. Дадасет доступен только для исследовательских целей.
Крупномасштабные видеодатасеты и модели, обученные на них, всё больше концентрируются в руках небольшого числа преимущественно проприетарных технологических компаний, что ограничивает независимые научные исследования и воспроизводимость.
- voidUpdate
Чёрт, это же куча видео, чтобы связаться с создателями и спросить разрешения на использование их контента для обучения моделей. Если только они, конечно, не сделали этого, а просто взяли и скачали всё без спроса...
- vivzkestrel
- Может кто-нибудь со знанием дела дать обзор архитектуры, которая используется для этого?
- Допустим, вы запустили yt-dlp внутри python aiohttp.
- Наверняка вы быстро упрётесь в лимит, так как ваш IP-адрес будет заблокирован.
- Какие есть решения для автоматической ротации прокси в Python?
- Есть ли более хорошие, быстрые и надёжные способы скачать 100 миллионов видео, не получив блокировку по IP?
- topwalktown
"В целом мы попытались скачать 130 миллионов видео и добились успеха примерно в 60% случаев, получив 80 миллионов видео общей длительностью 10 миллионов часов."
Я поражён, что процент успеха такой высокий. Как YouTube их не заблокировал, ума не приложу. Но думаю, что этот список URL долго не проживёт, потому что YouTube очень быстро заблокирует любого исследователя, который попытается скачать эти видео самостоятельно.