4.5 млрд видео TikTok: как обойти защиту мобильного API и собрать данные

4.5B Posts Scraped from TikTok

Автор разбирает приватный HTTP+JSON API, используемый Android-приложением TikTok, и объясняет, как обойти его защиту: регистрация устройства, подпись запросов, региональные хосты и отпечаток TLS. На основе этого он собрал 3,23 млрд профилей, 5,94 млрд видео и 2,8 млрд комментариев за три недели, а 4,5 млрд видео выложил в открытый доступ на Hugging Face. Статья описывает 24 эндпоинта и типичные ошибки, включая «пустой ответ 200».

Это не 403. Это не 429. Это не страница с вызовом. Это успешный HTTP-ответ, содержащий ничего.
  1. 1vuio0pswjnm7

    1787990085 | Потери X и Meta в прошлых судебных исках о скрейпинге данных и как это относится к nitter | https://www.reuters.com/legal/musks-x-corp-loses-lawsuit-aga... | https://news.ycombinator.com/item?id=49487864

    Возможно, Google сможет добиться успеха там, где такие компании, как Meta и X, потерпели неудачу, а может, и нет

    https://storage.courtlistener.com/recap/gov.uscourts.cand.46...

  2. Retr0id

    Найдётся ли смельчак, который проберётся сквозь эту простыню от LLM и выдаст понятное человеку резюме?

  3. moinism

    > Всё, что здесь описано, — это приватный репозиторий на Go. Разовый платёж, постоянный доступ, полный исходный код.

    > $699 разово · пожизненный доступ

    Судя по всему, это не открытый исходный код.

    И я не могу найти тот пост на Reddit, но, кажется, читал, что видео/материалы на самом деле не загружаются заранее — их нужно запрашивать через API TikTok с помощью предоставленного кода. Так что если TikTok что-то запатчит, код тоже придётся обновлять.

  4. nomilk

    > Три вещи, которые стоит заметить, потому что каждая из них аукнется позже:

    Очень похоже на язык LLM!

  5. smallerize

    Этот датасет точно не выживет на Hugging Face, верно? Его завалят таким количеством DMCA-уведомлений.

Ещё за этот день

2026-09-03