4.5 млрд видео TikTok: как обойти защиту мобильного API и собрать данные
4.5B Posts Scraped from TikTok
Автор разбирает приватный HTTP+JSON API, используемый Android-приложением TikTok, и объясняет, как обойти его защиту: регистрация устройства, подпись запросов, региональные хосты и отпечаток TLS. На основе этого он собрал 3,23 млрд профилей, 5,94 млрд видео и 2,8 млрд комментариев за три недели, а 4,5 млрд видео выложил в открытый доступ на Hugging Face. Статья описывает 24 эндпоинта и типичные ошибки, включая «пустой ответ 200».
Это не 403. Это не 429. Это не страница с вызовом. Это успешный HTTP-ответ, содержащий ничего.
- 1vuio0pswjnm7
1787990085 | Потери X и Meta в прошлых судебных исках о скрейпинге данных и как это относится к nitter | https://www.reuters.com/legal/musks-x-corp-loses-lawsuit-aga... | https://news.ycombinator.com/item?id=49487864
Возможно, Google сможет добиться успеха там, где такие компании, как Meta и X, потерпели неудачу, а может, и нет
https://storage.courtlistener.com/recap/gov.uscourts.cand.46...
- Retr0id
Найдётся ли смельчак, который проберётся сквозь эту простыню от LLM и выдаст понятное человеку резюме?
- moinism
> Всё, что здесь описано, — это приватный репозиторий на Go. Разовый платёж, постоянный доступ, полный исходный код.
> $699 разово · пожизненный доступ
Судя по всему, это не открытый исходный код.
И я не могу найти тот пост на Reddit, но, кажется, читал, что видео/материалы на самом деле не загружаются заранее — их нужно запрашивать через API TikTok с помощью предоставленного кода. Так что если TikTok что-то запатчит, код тоже придётся обновлять.
- nomilk
> Три вещи, которые стоит заметить, потому что каждая из них аукнется позже:
Очень похоже на язык LLM!
- smallerize
Этот датасет точно не выживет на Hugging Face, верно? Его завалят таким количеством DMCA-уведомлений.