Spotify 如何用 RAP 加速数据湖点查询
Indexing the Data Lake for Online Point Queries

Spotify 面临海量数据实时查询的挑战,传统分布式 SQL 引擎如 Trino 和 BigQuery 因调度开销无法满足在线点查询的低延迟需求。文章介绍了 Random Access Parquet (RAP) 方案,通过外部索引将键直接映射到文件位置,实现 O(1) 查找。RAP 无需修改现有 Parquet 文件,即可在 GCS 数据湖上高效执行点查询,同时支持排序、分组等优化策略,显著降低延迟和带宽消耗。
瓶颈不再在于存储层本身,而在于其上的查询引擎:像 Trino 和 BigQuery 这样的分布式 SQL 引擎,即使对于单行查找,也会增加数秒的作业调度和查询规划开销。