扫描 7.6PB HuggingFace 数据发现 22 万密钥

Scanning 7.6 Petabytes of HuggingFace Training Data for Secrets

扫描 7.6PB HuggingFace 数据发现 22 万密钥

我们扫描了 HuggingFace 上所有公开数据集,总计 7.6PB、1.87 亿个文件,发现了 221,303 个活跃且唯一的凭证。这些密钥不仅包含可写入 GitHub 仓库、推送 Docker 镜像的高权限 Token,还涉及 8,557 个 GCP 服务账号密钥、51.7TB 的私有 AWS S3 存储以及 8,594 个活跃数据库登录凭证。更令人担忧的是,其中包含 11,496 个 OpenAI、Anthropic 等 AI 服务商的密钥,若被滥用,每年可能导致至少 92 万美元的 AI 推理费用损失。此次扫描揭示了 AI 训练数据中普遍存在的安全隐患,部分密钥甚至能访问全球约 3.7% 人口的个人信息。

单个顶级账户密钥若被耗尽至其限额,一个月的账单就超过了我们运行这次 7.6PB 扫描的全部成本。
  1. croemer

    原则上挺有意思,但我实在受不了这种 Claude 写出来的文风。

    > 具有真实爆炸半径的密钥

    > 它们能解锁什么。

    > 这只是个底线,并非实际余额或未经授权使用情况的估算。这些密钥已验证但从未被使用。

    > 我们从头到尾克隆了公共数据集 hub:每个仓库、每个分支、每个大文件对象。

    > 规模只是故事的一半。这些是人们实际使用的模型背后的训练集。受冲击最严重的是那些被命名、有卡片文档记录的预训练语料库,开源模型就是基于它们构建的。我们针对其提供商验证了引用的每一个凭证,所以在我们查看时它们都是有效的。

    整篇帖子看起来就像个 Claude 生成的产物,里面还塞了些随机的小卡片。

    而且这也太长了,这是使用 LLM 的副作用,生成大段文字实在太容易了。

  2. ks2048

    我觉得"7.6 PB"比"相当于 4.4 倍帝国大厦高度的 DVD 容量"更有信息量,不过这只是我个人的看法。

  3. lorreyfum

    直接爬取整个网络不是更简单吗?不太明白 HuggingFace 在这里到底有什么关系。

同日更多故事

2026-08-01