LAION が 1,000 万時間のオープン動画データセット「LAION-BVD」を公開、マルチモーダル研究を前進
Laion Big Video Dataset
LAION は、CommonCrawl から収集した 13 億件の動画 URL から 8,000 万本、総再生時間 1,000 万時間に及ぶ大規模オープン動画データセット「LAION-BVD」を公開した。シーン検出でクリップ化し、映像・音声のキャプションを合成生成。ViCLIP は InternVid を最大 2.1% 上回り、音声・画像テキスト検索でも競争力のある性能を示す。研究目的に限定した公開で、商用利用は不可。
大規模な動画データセットとそれを用いたモデルは、少数の主にプロプライエタリなテクノロジー企業に集中しており、独立した科学研究と再現性が制限されています。
HNでの議論
16- voidUpdate
うわ、それは彼らがクリエイターに連絡して、そのコンテンツを機械学習のトレーニングデータとして使う許可を求めるには、ものすごい量の動画だな。もちろん、彼らがそれをしなかったか、あるいはとにかく先に進んでしまった場合の話だけどね。
- vivzkestrel
・専門知識がある人に、これを行うアーキテクチャの概要を教えてもらえますか?
・例えば、Pythonのaiohttp内でyt-dlpを実行したとします。
・きっとすぐに制限にぶつかりますよね。IPアドレスがフラグされるから。
・Pythonでプロキシを自動ローテーションするための解決策は何がありますか?
・IPアドレスをブロックされずに1億本の動画をダウンロードする、より良くて、速くて、信頼性の高い方法はありますか?
- topwalktown
「全体として、1億3000万本の動画のダウンロードを試み、リンク成功率は約60%で、結果として8000万本の動画を取得し、総再生時間は1000万時間に達しました。」
成功率がこんなに高いことに驚かされます。YouTubeが彼らをブロックしなかったのは、どうしてなのかわかりません。しかし、このURLリストは長持ちしないと思います。なぜなら、YouTubeは研究者が自分たちでこれらの動画をダウンロードしようとするのを、すぐにブロックするからです。