Erste Methode übersetzt Embeddings ohne gepaarte Daten
Harnessing the Universal Geometry of Embeddings
Forschende von der Cornell University stellen eine neue, unüberwachte Methode vor, die Text-Embeddings aus verschiedenen Vektorräumen ohne gepaarte Daten, Encoder oder vordefinierte Übereinstimmungen übersetzt. Die Übersetzung erfolgt über eine universelle latente Repräsentation, die auf der Platonic Representation Hypothesis basiert. Die Ergebnisse erreichen hohe Cosine-Ähnlichkeiten zwischen Modellen mit unterschiedlichen Architekturen, Parameterzahlen und Trainingsdaten. Die Autoren warnen vor Sicherheitsrisiken für Vektordatenbanken: Angreifer könnten aus Embeddings sensible Informationen extrahieren.
Ein Angreifer, der nur Zugriff auf Embedding-Vektoren hat, kann sensible Informationen über die zugrunde liegenden Dokumente extrahieren, die für Klassifikation und Attributinferenz ausreichen.