无需配对数据,Embeddings 跨空间翻译实现
Harnessing the Universal Geometry of Embeddings
这项研究提出了一种全新的无监督方法,能够在没有任何配对数据、编码器或预定义匹配集的情况下,将文本 Embeddings 从一个向量空间翻译到另一个。该方法基于 Platonic Representation Hypothesis,将任意 Embedding 映射到通用的潜在表示中,并在不同架构、参数量及训练数据集的模型间实现了高余弦相似度。这一突破不仅统一了语义结构,更对 Vector Databases 的安全性构成了严峻挑战:攻击者仅凭 Embedding 向量即可提取底层文档的敏感信息,足以进行分类和属性推断,彻底改变了我们对向量数据隐私的认知。
将未知 Embeddings 翻译到不同空间同时保持其几何结构的能力,对 Vector Databases 的安全性具有深远影响。