현실 데이터베이스의 어려움을 외면한 Text-to-SQL 벤치마크는 무의미하다
Any text-to-SQL benchmark should address difficulties of real-world data stores

컴퓨터 과학자이자 데이터베이스 전문가인 마이클 스톤브레이커는 현재의 Text-to-SQL 벤치마크가 실제 세계의 데이터 저장소가 지닌 복잡성을 반영하지 못한다고 비판한다. 그는 대부분의 벤치마크가 깨끗하고 잘 정리된 데이터셋을 사용하지만, 실제 데이터는 스키마가 복잡하고, 데이터가 중복되거나 누락되며, 다양한 형식으로 혼재되어 있다고 지적한다. 따라서 LLM이 벤치마크에서 높은 정확도를 보여도 실제 환경에서는 성능이 크게 떨어진다고 주장한다. 그는 Text-to-SQL 시스템의 실질적인 유용성을 평가하려면 벤치마크가 현실의 데이터 저장소가 가진 어려움을 반드시 포함해야 한다고 강조한다.
실제 데이터 저장소는 깔끔한 벤치마크 데이터셋과 달리 스키마가 지저분하고, 데이터가 중복되거나 누락되며, 다양한 형식이 혼재해 있어 Text-to-SQL 시스템의 성능을 제대로 평가하려면 이러한 현실적 어려움을 벤치마크에 반영해야 한다.