ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的多层企业Oracle基准
1. 摘要
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖于简化的学术模式(schemas)和开源SQL方言,无法反映企业数据库环境的复杂性。我们引入了ESQ-Bench,这是一个以Oracle优先的NL2SQL基准,具有系统化的复杂度层级(complexity tiers),并在三个企业模式复杂度层级上评估静默分歧(silent divergence)。我们构建并发布了六个填充模式(465张表,164,682行,零空表),在Oracle、PostgreSQL、MySQL和SQL Server上使用相同的种子数据,并配备了一个四指标评估框架(EM、EX、SR、SD)以及550个经过金标准验证的问题-查询对(Tier-1:95;Tier-2:228;Tier-3:227)。使用GPT-4o进行模式链接提示(schema-linked prompting)显示,跨层级的执行匹配度单调下降:在已执行查询上,EX分别为79.8%、60.3%和57.2%(2026年6月),而早期142个问题的试点切片上,EX分别为75.6%、80.4%和95.8%。EM在整个层级中保持在7%以下;在EX通过的查询中,操作静默分歧(operational silent divergence)达到73%至99%。失败分析显示,在较高层级中,错误结果语义占主导。使用模式链接提示的Claude Sonnet 4.6在已执行查询上达到87.4%、74.9%和68.7%的EX,在每个层级上都超过了GPT-4o模式链接。GPT-4o零样本(zero-shot)在已执行查询上的EX(78.7%、73.5%和77.8%)在Tier-2和Tier-3上反转了模式链接的结果,这是由于零样本与模式链接分析中执行率较低和幸存者偏差(survivor bias)所致。本地Llama 3.2模式链接在银行范围内仅达到13.3%的EX(550个中的73个),凸显了封闭API模型与开放权重基线在企业Oracle模式上的差距。
2. 引言
自然语言转SQL(NL2SQL)技术近年来取得了显著进展,现有模型在学术基准上表现出色。然而,这些基准通常使用简化的学术模式和开源SQL方言,与企业实际使用的数据库环境存在较大差异。企业数据库往往包含复杂的模式结构、专有的SQL方言(如Oracle的PL/SQL)以及严格的数据完整性约束。这种差异导致在学术基准上表现优异的模型在企业场景中可能失效。此外,现有评估主要关注执行准确率,忽略了静默语义分歧——即查询执行成功但返回错误结果的情况。为了填补这一空白,我们提出了ESQ-Bench基准,专门设计用于评估NL2SQL模型在企业Oracle环境中的方言泛化能力和静默语义分歧。
3. 基准设计
ESQ-Bench包含三个企业模式复杂度层级(Tier-1、Tier-2、Tier-3),每个层级对应不同复杂度的数据库模式。我们构建了六个填充模式,总计465张表、164,682行数据,确保所有模式在Oracle、PostgreSQL、MySQL和SQL Server上具有相同的种子数据,以消除数据库系统差异对评估的影响。评估框架采用四个指标:精确匹配(EM)、执行匹配(EX)、成功率(SR)和静默分歧(SD)。我们发布了550个经过金标准验证的问题-查询对,其中Tier-1有95个,Tier-2有228个,Tier-3有227个。这些查询对覆盖了从简单查询到复杂多表连接和子查询的广泛场景。
4. 实验设置
我们使用GPT-4o、Claude Sonnet 4.6和Llama 3.2作为代表模型进行实验。对于每个模型,我们测试了两种提示策略:零样本(zero-shot)和模式链接(schema-linked)。模式链接提示将数据库模式信息(如表名、列名和关系)嵌入到提示中,以帮助模型理解数据库结构。所有实验在2026年6月进行,使用相同的硬件和软件环境。我们记录了每个模型在不同层级上的EM、EX、SR和SD指标,并进行了详细的失败分析。
5. 结果与分析
实验结果显示,GPT-4o在模式链接提示下,EX从Tier-1的79.8%下降到Tier-3的57.2%,呈现单调递减趋势。相比之下,早期142个问题的试点切片中,EX从Tier-1的75.6%上升到Tier-3的95.8%,表明模型在简单问题上可能过拟合。EM在所有层级中均低于7%,说明精确匹配非常困难。静默分歧在EX通过的查询中占比高达73%至99%,意味着大多数成功执行的查询返回了错误结果。Claude Sonnet 4.6在模式链接下表现更优,EX分别为87.4%、74.9%和68.7%,全面超过GPT-4o。GPT-4o零样本在Tier-2和Tier-3上反转了模式链接的结果,这归因于执行率较低和幸存者偏差。Llama 3.2在银行范围内仅达到13.3%的EX,显示出开放权重模型与企业级Oracle模式之间的巨大差距。
6. 失败分析
我们对失败案例进行了深入分析,发现错误结果语义(wrong-result semantics)在较高层级中占主导地位。这意味着模型生成的SQL查询能够成功执行,但返回的结果与预期不符。常见错误包括:错误使用聚合函数、忽略WHERE条件、错误的连接类型或连接顺序、以及处理NULL值不当。这些错误在复杂模式中更为常见,因为模式中的表关系和约束更加复杂。此外,静默分歧的高发生率表明,仅依赖执行准确率作为评估指标是不够的,需要更全面的评估框架。
7. 相关工作与讨论
与现有基准(如Spider和BIRD)相比,ESQ-Bench更贴近企业实际场景,强调方言泛化和静默语义分歧。我们的工作揭示了学术基准与企业应用之间的差距,并提供了更严格的评估标准。未来工作可以扩展ESQ-Bench以覆盖更多数据库系统(如IBM Db2和SAP HANA),并引入更多复杂查询类型(如递归查询和窗口函数)。此外,我们计划探索如何利用模式链接提示和模型微调来提高企业场景下的NL2SQL性能。
8. 结论
ESQ-Bench提供了一个多层级的企业Oracle基准,用于评估NL2SQL模型的方言泛化能力和静默语义分歧。实验表明,现有模型在企业场景下表现远低于学术基准,且静默分歧问题严重。我们的基准和评估框架为NL2SQL研究提供了更贴近实际的测试平台,有助于推动该领域在企业应用中的发展。
ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的多层企业Oracle基准
1. 摘要
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖于简化的学术模式(schemas)和开源SQL方言,无法反映企业数据库环境的复杂性。我们引入了ESQ-Bench,这是一个以Oracle优先的NL2SQL基准,具有系统化的复杂度层级(complexity tiers),并在三个企业模式复杂度层级上评估静默分歧(silent divergence)。我们构建并发布了六个填充模式(465张表,164,682行,零空表),在Oracle、PostgreSQL、MySQL和SQL Server上使用相同的种子数据,并配备了一个四指标评估框架(EM、EX、SR、SD)以及550个经过金标准验证的问题-查询对(Tier-1:95;Tier-2:228;Tier-3:227)。使用GPT-4o进行模式链接提示(schema-linked prompting)显示,跨层级的执行匹配度单调下降:在已执行查询上,EX分别为79.8%、60.3%和57.2%(2026年6月),而早期142个问题的试点切片上,EX分别为75.6%、80.4%和95.8%。EM在整个层级中保持在7%以下;在EX通过的查询中,操作静默分歧(operational silent divergence)达到73%至99%。失败分析显示,在较高层级中,错误结果语义占主导。使用模式链接提示的Claude Sonnet 4.6在已执行查询上达到87.4%、74.9%和68.7%的EX,在每个层级上都超过了GPT-4o模式链接。GPT-4o零样本(zero-shot)在已执行查询上的EX(78.7%、73.5%和77.8%)在Tier-2和Tier-3上反转了模式链接的结果,这是由于零样本与模式链接分析中执行率较低和幸存者偏差(survivor bias)所致。本地Llama 3.2模式链接在银行范围内仅达到13.3%的EX(550个中的73个),凸显了封闭API模型与开放权重基线在企业Oracle模式上的差距。
2. 引言
自然语言转SQL(NL2SQL)技术近年来取得了显著进展,现有模型在学术基准上表现出色。然而,这些基准通常使用简化的学术模式和开源SQL方言,与企业实际使用的数据库环境存在较大差异。企业数据库往往包含复杂的模式结构、专有的SQL方言(如Oracle的PL/SQL)以及严格的数据完整性约束。这种差异导致在学术基准上表现优异的模型在企业场景中可能失效。此外,现有评估主要关注执行准确率,忽略了静默语义分歧——即查询执行成功但返回错误结果的情况。为了填补这一空白,我们提出了ESQ-Bench基准,专门设计用于评估NL2SQL模型在企业Oracle环境中的方言泛化能力和静默语义分歧。
3. 基准设计
ESQ-Bench包含三个企业模式复杂度层级(Tier-1、Tier-2、Tier-3),每个层级对应不同复杂度的数据库模式。我们构建了六个填充模式,总计465张表、164,682行数据,确保所有模式在Oracle、PostgreSQL、MySQL和SQL Server上具有相同的种子数据,以消除数据库系统差异对评估的影响。评估框架采用四个指标:精确匹配(EM)、执行匹配(EX)、成功率(SR)和静默分歧(SD)。我们发布了550个经过金标准验证的问题-查询对,其中Tier-1有95个,Tier-2有228个,Tier-3有227个。这些查询对覆盖了从简单查询到复杂多表连接和子查询的广泛场景。
4. 实验设置
我们使用GPT-4o、Claude Sonnet 4.6和Llama 3.2作为代表模型进行实验。对于每个模型,我们测试了两种提示策略:零样本(zero-shot)和模式链接(schema-linked)。模式链接提示将数据库模式信息(如表名、列名和关系)嵌入到提示中,以帮助模型理解数据库结构。所有实验在2026年6月进行,使用相同的硬件和软件环境。我们记录了每个模型在不同层级上的EM、EX、SR和SD指标,并进行了详细的失败分析。
5. 结果与分析
实验结果显示,GPT-4o在模式链接提示下,EX从Tier-1的79.8%下降到Tier-3的57.2%,呈现单调递减趋势。相比之下,早期142个问题的试点切片中,EX从Tier-1的75.6%上升到Tier-3的95.8%,表明模型在简单问题上可能过拟合。EM在所有层级中均低于7%,说明精确匹配非常困难。静默分歧在EX通过的查询中占比高达73%至99%,意味着大多数成功执行的查询返回了错误结果。Claude Sonnet 4.6在模式链接下表现更优,EX分别为87.4%、74.9%和68.7%,全面超过GPT-4o。GPT-4o零样本在Tier-2和Tier-3上反转了模式链接的结果,这归因于执行率较低和幸存者偏差。Llama 3.2在银行范围内仅达到13.3%的EX,显示出开放权重模型与企业级Oracle模式之间的巨大差距。
6. 失败分析
我们对失败案例进行了深入分析,发现错误结果语义(wrong-result semantics)在较高层级中占主导地位。这意味着模型生成的SQL查询能够成功执行,但返回的结果与预期不符。常见错误包括:错误使用聚合函数、忽略WHERE条件、错误的连接类型或连接顺序、以及处理NULL值不当。这些错误在复杂模式中更为常见,因为模式中的表关系和约束更加复杂。此外,静默分歧的高发生率表明,仅依赖执行准确率作为评估指标是不够的,需要更全面的评估框架。
7. 相关工作与讨论
与现有基准(如Spider和BIRD)相比,ESQ-Bench更贴近企业实际场景,强调方言泛化和静默语义分歧。我们的工作揭示了学术基准与企业应用之间的差距,并提供了更严格的评估标准。未来工作可以扩展ESQ-Bench以覆盖更多数据库系统(如IBM Db2和SAP HANA),并引入更多复杂查询类型(如递归查询和窗口函数)。此外,我们计划探索如何利用模式链接提示和模型微调来提高企业场景下的NL2SQL性能。
8. 结论
ESQ-Bench提供了一个多层级的企业Oracle基准,用于评估NL2SQL模型的方言泛化能力和静默语义分歧。实验表明,现有模型在企业场景下表现远低于学术基准,且静默分歧问题严重。我们的基准和评估框架为NL2SQL研究提供了更贴近实际的测试平台,有助于推动该领域在企业应用中的发展。