BBC/EBU 2025 AI助手信息完整性研究解读:AI可能说错、引错或漏掉条件,中国制造企业怎样守住产品事实?
18个国家、14种语言、22家公共媒体机构参与评估:45%的新闻问答存在至少一项重大问题;这不是工业品或B2B采购测试,不能把该比例直接套到产品答案
给企业老板的结论很直接:被AI提到不等于被准确介绍。AI可能把相近型号混在一起,把旧证书当成当前证书,把某个市场的质保政策说成全球政策,或者引用了页面却没有保留测试条件。企业不必因为这项研究停止做GEO,也不能拿新闻问答的错误率推算工业品答案;更稳妥的做法是把高风险产品事实集中到可核验的权威页面,标清型号、版本、适用市场和限制,再用真实采购问题定期检查不同AI的回答。发现错误时,先修正自身公开资料与渠道冲突,再保留错误记录并通过平台反馈、客户说明和人工沟通纠正。
先看这项研究的基本盘
新闻问答至少存在一项重大问题
重大问题指可能对准确性、来源、事实与观点区分、额外立场或上下文产生实质影响;不是一般产品答案错误率。
回答存在重大来源问题
包括来源不支持相关说法、没有直接来源,以及错误或无法核验的归因;不同问题类别可能重叠,不能相加。
回答存在重大准确性问题
包括可能实质误导读者的错误、过时内容或不准确引语;测试发生于2025年5月至6月。
BBC/EBU原始研究如何支撑这些判断
每条证据都区分原始研究、GEO360解释和企业含义,不把新闻测试扩大成工业品测试。
01研究基础:跨18个国家、14种语言评估四类AI助手
Introduction / Methodology · P6–8, P60–64“22 Public Service Media organizations” · 22家公共媒体机构参与,测试ChatGPT、Copilot、Gemini和Perplexity当时的免费消费者版本,并由专业记者复核回答。
这是一项跨国家、跨语言、由领域人员人工复核的大规模新闻问答研究,比单次随手提问更有参考价值。
企业可以借鉴它的核对方法,但不能把新闻问答结果直接当成工业品、B2B采购或当前模型的错误率。
02重大问题不只包括事实错误,也包括来源和条件缺失
High-level findings · P9–10“45% of all AI responses” · 45%的核心问题回答至少存在一项重大问题;来源、准确性和上下文是最主要的检查维度。
一条答案即使主要结论没错,只要来源不支持、条件缺失或旧信息未说明,也可能实质误导读者。
制造企业要检查的不只是“有没有提到我”,还包括型号、单位、版本、适用市场、证书范围和限制是否完整。
03AI很少拒答,确定语气可能掩盖证据不足
Over-confidence / Methodology · P24, P63“only 17 questions” · 完整3,113条提问中只有17条被拒绝回答,约占0.5%;报告提醒,回答意愿提高不等于回答质量提高。
企业最需要防范的是“听起来很确定、实际少了条件”的答案,特别是涉及认证、工程、安全和安装的问题。
高风险问题必须把人工确认写进客户路径,不能把AI回答当作最终技术、认证或合规意见。
这些数字能说明什么,不能说明什么
45%、31%和20%是不同检查维度,彼此可能重叠,不能相加;它们也不是工业品答案错误率。
| 原报告数字 | 正确口径 | 不能写成 |
|---|---|---|
| 45% | 核心新闻问答至少有一项重大问题 | 45%的AI产品推荐都是错的 |
| 31% | 回答存在重大来源问题或缺少直接来源 | 31%的企业官网引用都会失效 |
| 20% | 回答存在可能实质误导读者的准确性问题 | 某个平台当前准确率只有80% |
| 17 / 3,113 | 完整提问数据集中只有17次拒答 | AI会回答99.5%的工业采购问题 |
从新闻问答证据到制造企业判断
AI回答看起来完整,仍可能在关键事实或条件上出错
BBC/EBU在核心问题评估中发现,45%的回答至少有一项重大问题,20%存在重大准确性问题,14%缺少足够上下文。研究中的问题包括过时事实、不准确引语,以及没有说明读者理解答案所需的背景。
对制造企业而言,最危险的不一定是整段胡说,而是答案大体正确却漏掉型号、单位、测试条件、认证适用范围、日期或例外。这类回答更容易被客户当真,也更难在第一眼发现。
企业应把高风险事实写成带型号、版本、适用范围和更新时间的独立内容,避免用一段系列宣传覆盖所有产品和市场。
有来源链接,不代表链接真的支持AI给出的说法
原研究把来源问题定义为:回答中的说法没有得到所列来源支持、没有提供直接来源,或作出错误、无法核验的来源声明。31%的回答存在重大来源问题,是研究中最突出的错误类别。
AI可能引用企业首页、旧新闻、经销商页面或第三方转载,却把它们当成某个型号、当前认证或现行政策的证明。链接本身会制造可信感,但买家点开后未必能找到对应依据。
每个重要结论应尽量回到具体产品页、证书说明页、测试说明或政策页;页面标题和正文明确回答它证明什么、不证明什么。
AI很少拒答,企业不能等客户指出错误后才处理
在完整3,113条核心与自定义问题数据集中,只有17条被拒绝回答,约占0.5%。报告认为,助手更愿意给出答案,即使它未必能提供高质量回答;确定的语气和大量来源也可能制造权威感。
当客户询问某型号是否符合某国标准、证书是否覆盖某系列、能否用于特定环境时,AI可能给出看似肯定的结论。涉及工程、认证、安装和安全的问题,错误答案的代价远高于一般宣传偏差。
对高风险问题建立人工核验与接管规则:AI答案只能作为线索,最终以当前技术文件、认证范围和专业人员确认结果为准。
三种容易被AI说错的制造业场景
以下均为模拟场景(非真实业绩案例),只用于说明风险和处理方法。
AI把欧盟230V型号的认证资料套到北美120V型号,并把区域质保写成全球质保。
拆分市场版本页面,逐个型号写清电压、插头、认证覆盖、固件或配置差异与质保地区。
AI从系列页概括单个型号的防护等级,却漏掉测试条件、安装位置和适用环境。
型号页提供IP等级、测试依据、安装限制、报告编号和更新时间,系列页只做导航,不代替型号结论。
AI引用旧版材料说明或证书页面,给出看似明确但已经过期的标准与适用范围。
为当前资料设置唯一标准页,标注版本日期;旧页面保留说明并跳转,不让多套口径长期并存。
中国制造企业建议先做这三件事
- 01 第一步
由产品、质量、外贸和网站负责人选出20—30个高风险问题,优先覆盖型号差异、材料与参数、适用标准、认证范围、安装限制、质保地区、交期和最小起订量。
- 02 第二步
为每个高风险问题指定唯一事实源,写清型号、单位、测试条件、证书编号与覆盖范围、版本日期、适用市场和不能得出的结论;同步官网、目录、经销商页面和业务回复。
- 03 第三步
按月在目标市场常用的AI与搜索入口复测,分别记录回答是否正确、来源是否支持、条件是否完整和是否需要人工接管;发现错误后保留截图、日期、提示词与修正记录。
老板每月复盘时,还要问这三个问题
- 01客户最容易因为哪三类错误做出错误判断:型号、认证,还是交付与质保?
- 02官网、产品目录、经销商页面和业务回复,哪一个仍在使用旧版本?
- 03发现AI回答错误后,谁负责留档、修正资料、反馈平台并向客户解释?
接下来值得关注的变化
- 1.企业的GEO工作会从只看有没有被提及,逐步增加答案准确性、来源正确性、版本时效和条件完整性的检查。
- 2.型号多、市场版本多、认证范围复杂的产品,更需要维护唯一事实源和清楚的页面关系,减少AI跨页面拼接时的歧义。
- 3.随着模型、搜索接口和回答方式持续更新,一次测试不能长期代表平台表现;持续抽查会比一次性的推荐率截图更有价值。
趋势判断与资料边界
- 1.原研究测试的是新闻与时事问答,不是工业品、B2B采购或中国制造企业;45%、31%和20%不能直接外推到产品答案。
- 2.测试使用2025年5月至6月的免费消费者版本,模型和搜索能力已经变化;平台间数字不能当作永久排名,也不能据此决定单一平台预算。
- 3.统一事实源和清楚页面能够降低理解与核验成本,但无法控制模型如何生成每次回答,也不能保证准确引用、推荐、询盘或成交。
News Integrity in AI Assistants: An international PSM study
European Broadcasting Union(欧洲广播联盟,EBU)与 BBC · 2025-10-21
【资料边界】本文是对BBC与欧洲广播联盟《News Integrity in AI Assistants: An international PSM study》的中文商业解读,不是GEO360自行开展的AI平台测试。原研究由22家公共媒体机构参与,覆盖18个国家和14种语言;2025年5月24日至6月10日生成回答,271名记者评估2,709条核心问题回答和353条自定义问题回答,完整提问数据集为3,113条。测试对象是ChatGPT、Copilot、Gemini和Perplexity当时的免费消费者版本,问题集中在新闻与时事,并通过提示词鼓励使用指定公共媒体来源。报告发布后模型已经更新,因此45%、31%、20%和17次拒答只代表该研究设计与时间窗口,不能当作工业品、B2B采购、中国出口企业或当前模型的错误率。本文行业内容均为模拟场景,不承诺AI准确引用、推荐、询盘或成交。