一句话定义
AI 答案准确率(AI Answer Accuracy)是经核验为准确的品牌事实陈述数,占已完成准确、过时或错误判定的可核验陈述数的比例。
可以把它理解为给 AI 的品牌介绍做「事实校对」。态度是否正面不影响事实判断:一句夸奖如果写错功能,仍然不准确;一句风险提示若有可靠依据,可能是准确的负面信息。
为什么重要
品牌被频繁提及或推荐,不代表可见性健康。错误价格、过期产品、混淆的主体关系和虚构功能都可能直接误导用户。准确率给提及率和推荐率加上一道质量约束,也让修复工作能落到具体事实。
| 核验状态 | 定义 | 准确率 | 判定覆盖率 |
|---|---|---|---|
| 准确 | 与现行、可核验依据一致 | 进入分子和分母 | 计为已判定 |
| 过时 | 曾经成立,但已被新版事实替代 | 只进入分母,单列原因 | 计为已判定 |
| 错误 | 从未成立或与适用条件下的依据冲突 | 只进入分母,单列原因 | 计为已判定 |
| 无据 / 无法判定 | 已纳入核验,但当前证据不足 | 不进入分母 | 计入待判定总量 |
| 不可核验 | 主观评价或没有事实判定条件 | 不进入 | 不进入 |
核验机制
建立口径可按以下步骤进行:
- 拆分陈述。 把一段答案拆成主体、产品、功能、时间、价格、归属等单一事实。
- 指定依据。 优先使用当前有效的官方资料、法规文件、产品文档或可核验权威来源。
- 保留条件。 同一事实可能受地区、版本、时间和适用对象限制。
- 双层复核。 自动识别可提高效率,高风险事实仍应由人工确认。
- 分别汇总。 准确、过时、错误、无据或无法判定应并列呈现;过时与错误都属于非准确,但不能合并成一个原因。
准确率只使用已经完成准确、过时或错误判定的可核验陈述:
准确率 = 准确陈述数 ÷ 已完成准确、过时或错误判定的可核验陈述数
无据或无法判定不应被强行算错,也不能从样本中悄悄删除。它们用于计算第二个指标:
判定覆盖率 = 已完成准确、过时或错误判定的可核验陈述数 ÷ 全部纳入核验范围的可核验陈述数
两个指标必须同时报告。准确率高而判定覆盖率低,可能只是大量难例尚未判定,不能据此宣称答案质量更好;同时呈现两者,才能避免通过排除无据或难判陈述虚增准确率。
与品牌幻觉的区别
品牌幻觉描述的是 AI 生成不存在、错误、过时或混淆信息的风险现象;准确率是衡量事实正确程度的统计口径。前者帮助分类问题,后者帮助观察范围内的质量变化。两者相关,但不能互相替代。
应用场景与边界
- -新品、价格、服务范围和集团关系等高风险事实复核。
- -不同模型、地区或时间窗口的答案质量比较。
- -内容修复前后的同题复测。
- -将错误追溯到过时官网、第三方转载或实体混淆。
使用前检查:
- -[ ] 事实基线本身已确认且带版本时间。
- -[ ] 主观推荐理由没有被硬算成事实。
- -[ ] 无据或无法判定未进入准确率分母,但保留在覆盖率分母。
- -[ ] 过时与错误都计为非准确,但在结果中保持两个独立类别。
- -[ ] 准确率与判定覆盖率同时报告。
- -[ ] 前后周期使用同一拆分与判定规则。
准确率不能证明答案完整,也不能保证未来回答不变,更不存在脱离事实类型和问题集的统一合格线。
延伸阅读
AI 答案准确率的核心不是筛掉难例后凑出高分,而是把已判定质量与尚未判定范围同时交代清楚。
