GEO360 研究院

全球AI搜索与企业GEO趋势研究

持续研究ChatGPT Search、Google AI Overview、Perplexity等平台如何理解、引用和推荐企业网站,以及这些变化对中国制造企业海外获客意味着什么。

报告索引(最新发布)

16
L3 等级报告解读
2026-08-03

BBC/EBU 2025 AI助手信息完整性研究解读:AI可能说错、引错或漏掉条件,中国制造企业怎样守住产品事实?

分类: AI答案准确性与来源完整性
L3 等级报告解读
2026-07-29

皮尤研究中心 2025 Google AI 摘要点击研究解读:用户更少点开链接后,中国制造企业官网还要提供什么?

分类: AI摘要与网站点击
L3 等级报告解读
2026-07-27

埃森哲 2026 全球 AI 消费决策研究解读:当海外客户让 AI 代选产品,中国制造企业该把哪些真实价值说清楚?

分类: AI消费决策
L3 等级报告解读
2026-07-27

企业官网怎样进入AI搜索?从抓取、解析到检索引用,中国制造企业应先修哪些内容问题?

分类: AI采购行为主題升级 ★
L3 等级报告解读
2026-07-27

Forrester 2026 B2B采购信任解读:买家用 AI 做研究后,为什么更需要人工验证与可证明的供应商能力?

分类: AI采购行为主題升级 ★
L2 等级报告解读
2026-07-27

IDC 2026 制造业与供应链趋势解读:采购优化开始引入 AI,中国出口工厂先把哪些产品与质量数据准备好?

分类: AI采购行为主題升级 ★
L2 等级自研报告
2026-07-27

中国出口制造企业官网“六维供应商事实库”施工指南:从内部台账到页面发布与持续校验

分类: AI采购行为主題升级 ★
L3 等级报告解读
2026-07-27

麦肯锡 2026 采购智能体解读:AI正在进入寻源与供应商预审,中国制造企业怎样准备可核验的供应商资料?

分类: AI采购行为主題升级 ★
L3 等级报告解读
2026-07-27

Gartner 2026 战略预测解读:到2028年,90%的B2B采购将由AI智能体参与,中国制造企业先把哪些信息变得机器可读?

分类: AI采购行为主題升级 ★
L3 等级报告解读
2026-07-27

生成式 AI 进入 B2B 采购后,买家怎样从发现走到询盘?中国制造企业的四阶段响应指南

分类: AI采购行为主題升级 ★
L2 等级自研报告
2026-07-27

制造企业官网的“六维供应商事实库”怎么建?一套面向买家与 AI 核验的信息治理框架

分类: AI采购行为主題升级 ★
L3 等级报告解读
2026-07-27

AI Agent如何改变B2B供应商发现与预审:从机器参与到人工验证,中国制造企业应准备什么?

分类: AI采购行为主題升级 ★
L3 等级自研报告
2026-07-27

2026 B2B买家AI搜索与流量归因指南:从“被AI提及”到真实询盘,中国制造企业怎样建立可核验链路?

分类: AI采购行为主題升级 ★
L2 等级报告解读
2026-07-27

Perplexity如何引用网页并带来访问?从来源展示到真实询盘,中国制造企业怎样判断投入价值?

分类: GEO与SEO关系
L3 等级报告解读
2026-07-27

Semrush AI 搜索研究解读:Google AI Overviews 引用域名约 86% 与自然前十重合,传统 SEO 真的失效了吗?

分类: GEO与SEO关系主題升级 ★
L3 等级报告解读
2026-07-20

麦肯锡 2026 全球 B2B 调研解读:AI 开始帮买家找供应商,中国制造企业先把哪些信息写清楚?

分类: AI采购行为

GEO360研究边界声明

GEO360持续研究ChatGPT Search、Google AI Overview、Perplexity等AI搜索平台,重点关注它们如何理解企业网站、引用公开信息,并影响海外采购商寻找和判断供应商的方式。

我们不追逐泛AI热点和无关流量。公开内容主要围绕GEO、企业官网、产品表达、AI引用、海外采购变化和制造企业实践展开。

网站内容尽量基于公开资料、真实场景和可验证信息,并明确区分平台事实、研究观察与GEO360判断。
in/GEO360研究院
文档编号: R017L3 国际实证研究报告解读
发布日期: 2026-08-03

BBC/EBU 2025 AI助手信息完整性研究解读:AI可能说错、引错或漏掉条件,中国制造企业怎样守住产品事实?

18个国家、14种语言、22家公共媒体机构参与评估:45%的新闻问答存在至少一项重大问题;这不是工业品或B2B采购测试,不能把该比例直接套到产品答案

EXECUTIVE SUMMARY / 给企业决策者的结论

给企业老板的结论很直接:被AI提到不等于被准确介绍。AI可能把相近型号混在一起,把旧证书当成当前证书,把某个市场的质保政策说成全球政策,或者引用了页面却没有保留测试条件。企业不必因为这项研究停止做GEO,也不能拿新闻问答的错误率推算工业品答案;更稳妥的做法是把高风险产品事实集中到可核验的权威页面,标清型号、版本、适用市场和限制,再用真实采购问题定期检查不同AI的回答。发现错误时,先修正自身公开资料与渠道冲突,再保留错误记录并通过平台反馈、客户说明和人工沟通纠正。

REPORT AT A GLANCE

先看这项研究的基本盘

45%

新闻问答至少存在一项重大问题

重大问题指可能对准确性、来源、事实与观点区分、额外立场或上下文产生实质影响;不是一般产品答案错误率。

31%

回答存在重大来源问题

包括来源不支持相关说法、没有直接来源,以及错误或无法核验的归因;不同问题类别可能重叠,不能相加。

20%

回答存在重大准确性问题

包括可能实质误导读者的错误、过时内容或不准确引语;测试发生于2025年5月至6月。

SOURCE → INTERPRETATION → ACTION

BBC/EBU原始研究如何支撑这些判断

每条证据都区分原始研究、GEO360解释和企业含义,不把新闻测试扩大成工业品测试。

01研究基础:跨18个国家、14种语言评估四类AI助手

Introduction / Methodology · P6–8, P60–64
BBC/EBU 原文与中文解释

“22 Public Service Media organizations” · 22家公共媒体机构参与,测试ChatGPT、Copilot、Gemini和Perplexity当时的免费消费者版本,并由专业记者复核回答。

GEO360 如何理解

这是一项跨国家、跨语言、由领域人员人工复核的大规模新闻问答研究,比单次随手提问更有参考价值。

对制造企业意味着什么

企业可以借鉴它的核对方法,但不能把新闻问答结果直接当成工业品、B2B采购或当前模型的错误率。

02重大问题不只包括事实错误,也包括来源和条件缺失

High-level findings · P9–10
BBC/EBU 原文与中文解释

“45% of all AI responses” · 45%的核心问题回答至少存在一项重大问题;来源、准确性和上下文是最主要的检查维度。

GEO360 如何理解

一条答案即使主要结论没错,只要来源不支持、条件缺失或旧信息未说明,也可能实质误导读者。

对制造企业意味着什么

制造企业要检查的不只是“有没有提到我”,还包括型号、单位、版本、适用市场、证书范围和限制是否完整。

03AI很少拒答,确定语气可能掩盖证据不足

Over-confidence / Methodology · P24, P63
BBC/EBU 原文与中文解释

“only 17 questions” · 完整3,113条提问中只有17条被拒绝回答,约占0.5%;报告提醒,回答意愿提高不等于回答质量提高。

GEO360 如何理解

企业最需要防范的是“听起来很确定、实际少了条件”的答案,特别是涉及认证、工程、安全和安装的问题。

对制造企业意味着什么

高风险问题必须把人工确认写进客户路径,不能把AI回答当作最终技术、认证或合规意见。

DATA BOUNDARY

这些数字能说明什么,不能说明什么

45%、31%和20%是不同检查维度,彼此可能重叠,不能相加;它们也不是工业品答案错误率。

原报告数字正确口径不能写成
45%核心新闻问答至少有一项重大问题45%的AI产品推荐都是错的
31%回答存在重大来源问题或缺少直接来源31%的企业官网引用都会失效
20%回答存在可能实质误导读者的准确性问题某个平台当前准确率只有80%
17 / 3,113完整提问数据集中只有17次拒答AI会回答99.5%的工业采购问题
EVIDENCE TO BUSINESS JUDGMENT

从新闻问答证据到制造企业判断

01

AI回答看起来完整,仍可能在关键事实或条件上出错

BBC/EBU公开资料

BBC/EBU在核心问题评估中发现,45%的回答至少有一项重大问题,20%存在重大准确性问题,14%缺少足够上下文。研究中的问题包括过时事实、不准确引语,以及没有说明读者理解答案所需的背景。

GEO360 解释

对制造企业而言,最危险的不一定是整段胡说,而是答案大体正确却漏掉型号、单位、测试条件、认证适用范围、日期或例外。这类回答更容易被客户当真,也更难在第一眼发现。

企业含义

企业应把高风险事实写成带型号、版本、适用范围和更新时间的独立内容,避免用一段系列宣传覆盖所有产品和市场。

02

有来源链接,不代表链接真的支持AI给出的说法

BBC/EBU公开资料

原研究把来源问题定义为:回答中的说法没有得到所列来源支持、没有提供直接来源,或作出错误、无法核验的来源声明。31%的回答存在重大来源问题,是研究中最突出的错误类别。

GEO360 解释

AI可能引用企业首页、旧新闻、经销商页面或第三方转载,却把它们当成某个型号、当前认证或现行政策的证明。链接本身会制造可信感,但买家点开后未必能找到对应依据。

企业含义

每个重要结论应尽量回到具体产品页、证书说明页、测试说明或政策页;页面标题和正文明确回答它证明什么、不证明什么。

03

AI很少拒答,企业不能等客户指出错误后才处理

BBC/EBU公开资料

在完整3,113条核心与自定义问题数据集中,只有17条被拒绝回答,约占0.5%。报告认为,助手更愿意给出答案,即使它未必能提供高质量回答;确定的语气和大量来源也可能制造权威感。

GEO360 解释

当客户询问某型号是否符合某国标准、证书是否覆盖某系列、能否用于特定环境时,AI可能给出看似肯定的结论。涉及工程、认证、安装和安全的问题,错误答案的代价远高于一般宣传偏差。

企业含义

对高风险问题建立人工核验与接管规则:AI答案只能作为线索,最终以当前技术文件、认证范围和专业人员确认结果为准。

SIMULATED MANUFACTURING SCENARIOS

三种容易被AI说错的制造业场景

以下均为模拟场景(非真实业绩案例),只用于说明风险和处理方法。

家电与消费电子

AI把欧盟230V型号的认证资料套到北美120V型号,并把区域质保写成全球质保。

拆分市场版本页面,逐个型号写清电压、插头、认证覆盖、固件或配置差异与质保地区。

灯饰与建材

AI从系列页概括单个型号的防护等级,却漏掉测试条件、安装位置和适用环境。

型号页提供IP等级、测试依据、安装限制、报告编号和更新时间,系列页只做导航,不代替型号结论。

五金与新能源配套

AI引用旧版材料说明或证书页面,给出看似明确但已经过期的标准与适用范围。

为当前资料设置唯一标准页,标注版本日期;旧页面保留说明并跳转,不让多套口径长期并存。

中国制造企业建议先做这三件事

  1. 01

    由产品、质量、外贸和网站负责人选出20—30个高风险问题,优先覆盖型号差异、材料与参数、适用标准、认证范围、安装限制、质保地区、交期和最小起订量。

  2. 02

    为每个高风险问题指定唯一事实源,写清型号、单位、测试条件、证书编号与覆盖范围、版本日期、适用市场和不能得出的结论;同步官网、目录、经销商页面和业务回复。

  3. 03

    按月在目标市场常用的AI与搜索入口复测,分别记录回答是否正确、来源是否支持、条件是否完整和是否需要人工接管;发现错误后保留截图、日期、提示词与修正记录。

老板每月复盘时,还要问这三个问题

  1. 01客户最容易因为哪三类错误做出错误判断:型号、认证,还是交付与质保?
  2. 02官网、产品目录、经销商页面和业务回复,哪一个仍在使用旧版本?
  3. 03发现AI回答错误后,谁负责留档、修正资料、反馈平台并向客户解释?

接下来值得关注的变化

  1. 1.企业的GEO工作会从只看有没有被提及,逐步增加答案准确性、来源正确性、版本时效和条件完整性的检查。
  2. 2.型号多、市场版本多、认证范围复杂的产品,更需要维护唯一事实源和清楚的页面关系,减少AI跨页面拼接时的歧义。
  3. 3.随着模型、搜索接口和回答方式持续更新,一次测试不能长期代表平台表现;持续抽查会比一次性的推荐率截图更有价值。

趋势判断与资料边界

  1. 1.原研究测试的是新闻与时事问答,不是工业品、B2B采购或中国制造企业;45%、31%和20%不能直接外推到产品答案。
  2. 2.测试使用2025年5月至6月的免费消费者版本,模型和搜索能力已经变化;平台间数字不能当作永久排名,也不能据此决定单一平台预算。
  3. 3.统一事实源和清楚页面能够降低理解与核验成本,但无法控制模型如何生成每次回答,也不能保证准确引用、推荐、询盘或成交。
原始报告与中文边界 // ORIGINAL SOURCE

News Integrity in AI Assistants: An international PSM study

European Broadcasting Union(欧洲广播联盟,EBU)与 BBC · 2025-10-21

【资料边界】本文是对BBC与欧洲广播联盟《News Integrity in AI Assistants: An international PSM study》的中文商业解读,不是GEO360自行开展的AI平台测试。原研究由22家公共媒体机构参与,覆盖18个国家和14种语言;2025年5月24日至6月10日生成回答,271名记者评估2,709条核心问题回答和353条自定义问题回答,完整提问数据集为3,113条。测试对象是ChatGPT、Copilot、Gemini和Perplexity当时的免费消费者版本,问题集中在新闻与时事,并通过提示词鼓励使用指定公共媒体来源。报告发布后模型已经更新,因此45%、31%、20%和17次拒答只代表该研究设计与时间窗口,不能当作工业品、B2B采购、中国出口企业或当前模型的错误率。本文行业内容均为模拟场景,不承诺AI准确引用、推荐、询盘或成交。