Traducen embeddings entre modelos sin datos pareados: un riesgo para las bases de datos vectoriales

Harnessing the Universal Geometry of Embeddings

Investigadores de la Universidad de Cornell presentan el primer método para traducir embeddings de texto entre espacios vectoriales sin necesidad de datos pareados, codificadores ni conjuntos de coincidencias predefinidos. Su enfoque no supervisado traduce cualquier embedding hacia y desde una representación latente universal, logrando alta similitud coseno entre modelos con diferentes arquitecturas, tamaños y datos de entrenamiento. Esta capacidad de traducir embeddings desconocidos preservando su geometría tiene serias implicaciones para la seguridad de las bases de datos vectoriales: un adversario con acceso solo a los vectores puede extraer información sensible de los documentos subyacentes, suficiente para clasificación e inferencia de atributos.

Un adversario con acceso solo a los vectores de embedding puede extraer información sensible sobre los documentos subyacentes, suficiente para clasificación e inferencia de atributos.

Más de este día

2026-09-06