爬取45亿TikTok视频的技术内幕

4.5B Posts Scraped from TikTok

大多数TikTok爬虫依赖无头浏览器或公开网页端点,速度慢且数据不全。本文揭示了TikTok Android应用使用的私有HTTP+JSON API,它更快、更稳定且返回数据更丰富。作者详细解析了绕过防护的四大关键:设备凭证注册、请求签名、区域主机匹配以及TLS握手指纹。最棘手的是,任何一项错误都会返回看似成功的HTTP 200但内容为空的响应,导致调试极难。通过修复这些问题并添加一个常被忽略的启动激活调用,系统在三周内成功收集了32.3亿创作者资料、59.4亿视频和28亿条评论,并将45亿视频数据开源至Hugging Face。

你的HTTP客户端报告成功,日志保持绿色,数据库却填满了空数据,没有任何错误信号告诉你问题出在哪。
  1. nomilk

    > 有三点值得注意,因为每一点日后都会让人吃瘪:

    > 这语言太像 LLM 生成的了!

  2. 1vuio0pswjnm7

    1787990085 | X 和 Meta 过去在数据爬取诉讼中的败诉及其与 nitter 的关联 | https://www.reuters.com/legal/musks-x-corp-loses-lawsuit-aga... | https://news.ycombinator.com/item?id=49487864

    也许 Google 能成功,而 Meta 和 X 却失败了;或者也许也不能。

    https://storage.courtlistener.com/recap/gov.uscourts.cand.46...

  3. Retr0id

    有没有哪位勇士能穿透这篇 LLM 生成的文字,提供一份人类可读的摘要?

  4. moinism

    > 这里描述的一切都是一个私有的 Go 仓库。一次性付费,永久访问,包含完整源码。

    > 699 美元一次性 · 终身访问

    看来并不是开源的。

    我找不到那条 reddit 帖子了,但我记得读到过,视频/素材其实并没有预先下载,而是需要用提供的代码通过 TikTok API 请求。所以如果 TikTok 修补了漏洞,代码也得跟着更新。

  5. smallerize

    这个数据集在 HF 上肯定活不下去吧?它肯定会遭到无数 DMCA 下架通知的打击。

同日更多故事

2026-09-03