Manticore Search ahora divide documentos largos en fragmentos para mejorar la búsqueda vectorial

Better Vector Search for Long Documents: Chunking Inside Manticore Search

Manticore Search ahora divide documentos largos en fragmentos para mejorar la búsqueda vectorial

Manticore Search introduce chunk_strategy en las columnas vectoriales para dividir documentos largos en fragmentos, generar embeddings de cada uno y buscarlos todos. Con cinco estrategias disponibles, los documentos siguen siendo un único resultado de búsqueda. En el manual de Manticore (189 páginas, ~298k palabras), la recuperación de contenido fuera de la ventana del modelo mejoró de 55.1% a 83.3% en recall@5 y de 0.44 a 0.70 en MRR, a cambio de ~2.5× más RAM y ~4× más tiempo de ingesta.

El modelo leyó las primeras 380 palabras y descartó las otras 3.600. Nada en el documento más allá de ese punto puede recuperarse jamás, y nada en ningún lugar te lo advirtió.

Más de este día

2026-09-17