扫描 7.6PB HuggingFace 数据发现 22 万密钥
Scanning 7.6 Petabytes of HuggingFace Training Data for Secrets
我们扫描了 HuggingFace 上所有公开数据集,总计 7.6PB、1.87 亿个文件,发现了 221,303 个活跃且唯一的凭证。这些密钥不仅包含可写入 GitHub 仓库、推送 Docker 镜像的高权限 Token,还涉及 8,557 个 GCP 服务账号密钥、51.7TB 的私有 AWS S3 存储以及 8,594 个活跃数据库登录凭证。更令人担忧的是,其中包含 11,496 个 OpenAI、Anthropic 等 AI 服务商的密钥,若被滥用,每年可能导致至少 92 万美元的 AI 推理费用损失。此次扫描揭示了 AI 训练数据中普遍存在的安全隐患,部分密钥甚至能访问全球约 3.7% 人口的个人信息。
单个顶级账户密钥若被耗尽至其限额,一个月的账单就超过了我们运行这次 7.6PB 扫描的全部成本。
- croemer
原则上挺有意思,但我实在受不了这种 Claude 写出来的文风。
> 具有真实爆炸半径的密钥
> 它们能解锁什么。
> 这只是个底线,并非实际余额或未经授权使用情况的估算。这些密钥已验证但从未被使用。
> 我们从头到尾克隆了公共数据集 hub:每个仓库、每个分支、每个大文件对象。
> 规模只是故事的一半。这些是人们实际使用的模型背后的训练集。受冲击最严重的是那些被命名、有卡片文档记录的预训练语料库,开源模型就是基于它们构建的。我们针对其提供商验证了引用的每一个凭证,所以在我们查看时它们都是有效的。
整篇帖子看起来就像个 Claude 生成的产物,里面还塞了些随机的小卡片。
而且这也太长了,这是使用 LLM 的副作用,生成大段文字实在太容易了。
- ks2048
我觉得"7.6 PB"比"相当于 4.4 倍帝国大厦高度的 DVD 容量"更有信息量,不过这只是我个人的看法。
- lorreyfum
直接爬取整个网络不是更简单吗?不太明白 HuggingFace 在这里到底有什么关系。