语义:指标与术语是否唯一
数据:水位、完整度与质量
查询:计划、守恒与执行状态
权限:身份与范围是否有效
表达:事实、推断与未知边界
结论:单一百分比不能代表企业答案可信
大模型可以对下一段文字很有把握,却选错企业指标;数据库也可能成功返回精确数字,但数据只同步到昨天。所谓“95% 置信度”若没有说明对象、计算方法和验证样本,容易把语言流畅度伪装成业务正确性。企业问数更适合展示多维证据与风险状态。
可把可信度拆成五层:问题是否被唯一理解、指标与过滤是否受治理、数据是否完整新鲜、查询是否通过技术与业务校验、解释是否只陈述证据支持的结论。任何一层出现高风险缺口,都不能被其他层的高分平均掉。
先区分统计置信、模型分数和业务保证
预测区间、抽样误差和假设检验有明确统计定义;分类模型概率需要校准;生成模型 token 概率只描述文本生成过程。三者都不能直接回答“销售额是否按公司口径算对”。业务答案还受数据血缘、权限、时间范围和指标版本影响。
因此页面不要只展示一个带绿色图标的百分比。若使用分数,必须注明它衡量哪一步、用什么样本校准、在哪些场景失效。对财务、合规和人事等高风险问题,证据缺失应触发人工确认或拒答,而不是靠更高的模型自评分放行。
语义证据检查问题是否被唯一解释
语义层应返回采用的 concept_id、指标定义、维度、过滤、时间角色、币种和组织范围。若“收入”同时可能指开票收入与会计确认收入,系统没有资格给出高可信结论,应展示候选差异并提问。连续会话还要说明继承了哪些已确认条件。
语义可信不是“与问题文字相似”。同义词命中后仍需检查业务域、地区和身份默认值。可以记录候选概念分差、规则匹配和澄清历史,但最终验收要用业务负责人确认的等价问题集,比较实际查询范围,而不是只比较文本答案。
数据证据需要水位、完整度与质量状态
答案至少说明共同数据截止时间、参与数据集状态、缺失分区和已知质量事件。销售更新到 10:00、成本只到昨日时,利润结论不能继承销售的最新时间。数据新鲜并不等于完整,完整也不代表主键、金额或枚举没有异常。
数据层可输出 freshness、coverage、quality_checks 和 backfill_version。若关键表处于 partial 或 failed 状态,策略可以退回上一个完整批次、只回答已就绪指标或拒绝。不能让模型根据几行样本自行判断全表“看起来正常”。
查询证据验证计划、执行与守恒
生成 SQL 后检查分区、Join 基数、聚合粒度、结果行数和执行状态。复杂问题拆成中间步骤,每步保存输入、输出粒度、行数、唯一键和总量。地区汇总应守恒到公司总额,订单头与订单行 Join 不得重复金额。
查询执行成功只证明数据库接受语法。证据区应能关联 query_id、语义版本和数据水位,并标记超时、截断、采样、缓存或近似计算。任何近似结果必须与精确财务数字分开,不能因图表看起来合理就省略说明。
权限证据必须反映回答时刻的身份
系统要记录用户、组织、项目、角色、策略版本和数据范围,并确认下游查询使用同一授权边界。共享数据库账号或服务账号不能抹掉真实主体。权限被撤销后,旧会话、缓存和导出链接也不能继续提供原数据。
对聚合答案还要考虑小样本反推。即使用户不能看明细,按单人或小门店切片也可能暴露敏感值。高风险指标可设置最小群组、字段脱敏和导出审批;这些控制应进入可信状态,而不是只写在隐私说明。
解释层要分开事实、推断和未知
“华东利润下降 8%”可以是已核验事实,“主要与产品结构变化同时发生”是关联线索,“结构变化导致利润下降”则需要更强因果证据。回答应为不同句子标注证据类型,列出未解释残差和替代原因,避免用肯定语气填补数据空白。
图表标题、摘要和行动建议必须继承同一边界。常见反例是正文写“相关”,结论卡片却写“原因”;或数据不完整提示藏在页尾,顶部仍展示确定数字。重要限制应与核心结论同屏出现。
按风险矩阵决定回答、澄清、降级或拒答
低风险探索且证据完整可直接回答;语义有两个候选时先澄清;数据轻微延迟但不影响趋势时可返回上一个完整批次并提示;涉及敏感明细、财务口径冲突或关键数据失败时应拒答或转人工。策略由业务影响和可逆性决定,不是所有问题共用一个阈值。
风险矩阵至少包含错误后果、数据敏感度、是否对外发布、是否触发业务动作和证据缺口。系统保存 policy_version 与决策理由,使团队能复盘为什么同样的模型分数在两个场景得到不同处理。
用校准集评估状态是否诚实
准备已知正确、语义歧义、数据缺失、权限撤销、Join 重复和因果不足的样本,检查系统是否给出相应状态。评价不仅看正确率,还看高可信答案错误率、该澄清却回答、该拒答却放行、低风险问题过度拒绝等校准指标。
校准集按业务域和风险分层,并保留版本。模型或语义更新后重跑,生产反馈进入独立验证集,不能直接用来调阈值再报告同一成绩。置信展示如果不能帮助用户做更好决策,就应简化为明确证据和限制。
落地清单与 AskTable.ai 边界
上线前确认:指标与术语可追溯、数据水位可读取、查询计划有校验、身份范围贯穿下游、事实与推断能区分、风险矩阵有责任人、状态经校准集验证。上线后监控高可信错误、澄清接受率、拒答复核和证据缺失,并定期由业务与数据负责人共同评审。
AskTable.ai 可以作为自然语言问数与连续分析入口参与这套方案,但本文不证明当前版本已提供统一“置信度”、自动因果判断或所有证据字段。语义配置、数据水位、查询校验、权限和页面展示应按实际部署逐项核验;无法验证时,诚实显示未知比输出百分比更可靠。
