01
问题:真实高频问法
02
身份:角色与数据范围
03
预期:指标、过滤与时间
04
执行:查询、结果与解释
05
判定:精确值、容差和人工复核
结论:测试问题的业务含义,不只测试 SQL 能运行
模型升级、字段改名、指标调整或业务文档更新,都可能让相同问题选择不同口径。查询成功不代表答案仍符合业务预期。
回归集应保存问题、提问身份、数据快照、预期指标、过滤、时间范围和允许误差。
从真实问题建立分层样本
覆盖标准问法、简称、错别字、模糊时间、连续追问和应当澄清的问题;同时包含拒答、无权限和数据不足样本。
按销售、库存、财务等主题以及风险等级分层,核心问题每次变更必测,长尾问题抽样测试。
答案要拆成多个判定点
分别比较指标、维度、过滤、Join、时间、权限、数值、图表和解释。文本不必逐字一致,但事实和边界必须一致。
对浮点、迟到数据和近实时数据设置合理容差,并记录基准数据版本。
把失败定位到变更层
同一问题保留语义解析、工具计划、查询、结果和最终表达,才能判断差异来自模型、语义层、数据还是权限。
通过版本化和灰度发布控制变更;高风险失败阻止发布,低风险差异进入人工评审。
用一次真实升级验收体系
选择一次模型或指标版本升级,运行完整回归集,检查失败归因、审批、例外记录、回退和重新发布。
AskTable.ai 可作为企业问数与语义配置候选;自动回归、版本对比、阈值和发布门禁能力需按当前产品确认。
