TikTokの非公開APIを解析、45億件の動画データをHugging Faceで公開
4.5B Posts Scraped from TikTok
TikTokのAndroidアプリが利用する非公開のHTTP+JSON APIを解析した技術ガイド。デバイス登録、リクエスト署名、リージョン別ホスト、TLSフィンガープリントの4つの壁を解説し、24のエンドポイントを文書化。このシステムで3週間で32.3億のクリエイタープロフィール、59.4億の動画、28億のコメントを収集。さらに、収集した45億件の動画データ(キャプション、再生回数、いいね数など)をHugging Faceで無料公開している。
成功したHTTPレスポンスが、何も含まない。エラーメッセージもステータスコードもない。あなたのHTTPクライアントは成功を報告し、ログは緑のままで、データベースは空のデータで満たされていく。
HNでの議論
58- 1vuio0pswjnm7
1787990085 | XとMetaの過去のデータスクレイピング訴訟での敗北と、それがNitterにどう関係するか | https://www.reuters.com/legal/musks-x-corp-loses-lawsuit-aga... | https://news.ycombinator.com/item?id=49487864
おそらくGoogleは、MetaやXのような他社が失敗したところで成功できるかもしれないし、できないかもしれない。
https://storage.courtlistener.com/recap/gov.uscourts.cand.46...
- Retr0id
勇敢な魂がこのLLMの散文をかき分けて、人間が読める要約を提供してくれないだろうか?
- moinism
> ここで説明されているものはすべてプライベートなGoリポジトリです。一回払いで、永久アクセス、完全なソースコード。
> $699 一回払い・生涯アクセス
どうやらオープンソースではないようだ。
そしてRedditの投稿は見つけられなかったが、動画やアセットは実際には事前にダウンロードされておらず、提供されたコードを使ってTikTokのAPIにリクエストする必要があると読んだ記憶がある。もしTikTokがパッチを当てれば、コードも更新が必要になるだろう。
- nomilk
> 注目すべき点が3つある。それぞれ後で痛い目を見るからだ。
非常にLLMらしい言い回しだ!
- smallerize
このデータセットがHF上で生き残ることは絶対にないだろう?DMCAの削除要求で攻められるに決まっている。