AI 公司正将用户对话数据泄露给广告商
AI companies leak data to advertisers [pdf]
随着 OpenAI 等巨头转向广告盈利模式,传统的网络追踪技术正悄然侵入 Conversational AI 服务。研究人员对 9 款主流对话 AI 进行深度分析,发现几乎所有服务都集成了第三方追踪器。更令人担忧的是,用户的对话标题、Prompt 甚至截图等敏感内容,正被连同用户标识符一同泄露给广告商。部分服务甚至公开了无访问控制的对话链接,导致整个聊天记录可能被追踪者读取。这项研究揭示了 AI 交互中全新的隐私攻击面,挑战了用户与 AI 之间“私密对话”的传统认知。
我们的研究结果表明,将传统追踪基础设施整合进对话式 AI 服务,创造了暴露敏感用户信息的新途径,包括对话衍生的内容片段和公开可访问的对话记录。
HN 评论区
121- pbasista
顺便提一句:
我最近注意到,例如 ChatGPT,当通过网页浏览器使用时,会定期将未完成的提示词发送到他们的服务器,具体是 `conversation/prepare` 端点,而无需等待用户真正发送。
这些部分提示词数据可能会被用来“预热”某种缓存。
但也可能被用来追踪用户的写作节奏、纠错风格,以及他们初步想法在形成提示词过程中的演变。我推测这类数据也可能被卖给广告商。
- kdaniel_03
这和本月早些时候 Navier-Stokes 积分之争的教训如出一辙。Buckmaster 和 Alpoge 的未发表草稿保存在私有的 Codex 会话中,OpenAI 声称没人见过这些草稿,但承认去标识化的产品数据可能提升了其模型。那里是训练数据,这里是广告追踪器。无论如何,本应保密的提示词和结果都未能保密。
这就是为什么即使开源模型并不完美,它也必须获胜。你可以跳过应用程序,自己运行模型。
- postalcoder
我注意到许多 AI 聊天服务中最讨厌的趋势之一是,它们似乎认为 URL 中的 UUID 就等同于隐私。
Perplexity 就是这样。访问过去的 Perplexity 搜索 URL 会暴露你的完整对话记录。
- delis-thumbs-7e
在一集老《辛普森一家》中,莉萨得以参观教师休息室,那里所有老师都在嘲笑孩子们。看门人威利正在模仿米尔豪斯:“哦,我是米尔豪斯,我把所有秘密都告诉威利,因为我没朋友!”老师们哄堂大笑。后来米尔豪斯发生了一些尴尬的事,他哭着立刻跑开:“我得告诉威利这个!”
我们现在都成了米尔豪斯。
- j4k0bfr
这让我有点惊讶,考虑到 AI 公司多么喜欢囤积数据。尤其是其中一些广告公司就是直接的竞争对手!
我最好的猜测是,这些广告机制有点仓促,和/或投资者对盈利的需求与公司自身利益发生了冲突。
编辑:我想为了 AI 聊天广告达到最佳效果,总会需要泄露一些数据。但我想象 AI 公司会更愿意自己投放定向广告,而不是让竞争对手代劳。看到 AI 公司自己也变成广告公司(而不仅仅是托管广告)会令人毛骨悚然。
- 20k
很多人似乎非常不愿承认 OpenAI 及其同类根本不在乎你。他们不在乎你签署的协议。对他们来说,你只是一堆现金。
- segmondy
在这个新 AI 时代之前,你的数据是被计算出来的,关于你的推断是“肤浅”的,但到了今天。可以了解你的那种画像和事物令人恐惧,尤其是如果你持续与云端 AI 互动。在我看来,使用云端 AI 的首要风险是隐私丧失和自由丧失。随着 AI 及其能力的发展,可以对人们施加更多控制,而你把自己暴露得越多,失去的就越多。
例如,我们现在有了自动驾驶汽车,到处都是摄像头。基于你与云端 AI 的对话,可以自动触发自动监控事件,利用摄像头车队、汽车、GPU、蜂窝信号在现实世界中跟随并追踪你。由于 AI 导致的追踪已经进入了现实世界,最终,一辆自动驾驶汽车会强行带你去“处理”,这甚至不是因为你公开论坛上的帖子,而是因为你与某个云端 AI 的私下闲聊和吐槽。
所以,一定要将本地 AI 纳入考虑,并将个人事务和想法仅保留在本地。
- troyvit
这篇论文关注的是提供商的网页和电话工具的使用,以及他们通过广告网络和 Data Dog 等追踪服务建立的数据共享安排。它没有讨论他们如何处理来自 API 调用的数据。一方面,这可能相当不透明。
我有一个朋友/客户,可以理解地不信任主要提供商现有的隐私政策。他们和我们许多人面临同样的问题:我们想要最强大的模型,愿意为此付费,但我们一遍又一遍地看到所谓的“前沿”实际上是多么的混乱。如果你手里没有枪,前沿就是丑陋的。
因此,目前像 Open WebUI 和 TypingMind 这样的平台工具可能是一个不错的变通方案,因为大公司(显然)目前并不在 API 数据上进行训练,或者(可能)不会将这些数据发送给广告商。如果能确认这一点会很有趣。