Text-to-SQL 基准测试难在真实数据
Any text-to-SQL benchmark should address difficulties of real-world data stores

Text-to-SQL 技术在实验室里表现优异,但一旦面对真实世界的数据库,往往就原形毕露。现有的基准测试大多基于简化、干净的数据集,完全忽略了现实场景中普遍存在的脏数据、复杂模式和不规范命名。如果无法解决这些实际困难,再先进的模型也难以落地。真正的挑战不在于生成语法正确的 SQL,而在于理解混乱且充满陷阱的真实数据存储。
任何 Text-to-SQL 基准测试都必须正视真实世界数据存储所面临的困难。