核心结论
- Profound 分析了 7 个全球引擎、14 个国家的 32.5 亿次引用,发现查询语言会显著改变引用模式;但研究没有覆盖中国大陆和中文答案引擎。
- Geolix.ai 的低代码 SaaS 案例包含 1,233 条中文有效回答和 15,353 条引用记录;同一品牌的提及率从 Perplexity 的 10.3% 到 DeepSeek 的 81.9%。
- 该案例中,中文引擎组与西方引擎组仅共享 68 个域名,引用域名 Jaccard 重合度为 12%。
- 低代码 SaaS 案例覆盖的 6 个引擎中,中文来源占比均在 90.4%—100%,包括 ChatGPT、Perplexity 和 Google AI Mode。
- 两个 Geolix.ai 案例只能作为互补证据,不能视为严格的中英文同题实验,因为品类、品牌、题目、日期、重复次数和引擎范围均不同。
全球研究已经证明了什么
Profound 的 2026 年 3 月研究覆盖 ChatGPT、Claude、Google AI Mode、Google AI Overviews、Gemini、Microsoft Copilot 和 Perplexity。社交来源在 Google AI Overviews 引用中占 15.3%,在 AI Mode 中占 14.5%,而 ChatGPT 为 9.1%、Claude 为 3.99%、Gemini 为 3.6%。正确解读不是“某一类信源永远有效”,而是引擎和市场语言会改变引用行为。
Sources: Profound 引用研究 | Peec AI 语言研究
Peec AI 提供了另一组独立采集的厂商数据:在超过 1,000 万个问题和 2,000 万次 fan-out 检索中,78% 的非英文会话补充使用了英文检索,非英文问题触发的 fan-out 检索有 43% 发生在英文网络。多语言检索领域的同行评审研究也发现语言偏好和高资源语言偏差。这些证据共同说明,翻译页面并不能保证形成等价的检索结果。
Sources: ACL 2025 多语言 RAG 研究 | ACL 2026 语言偏差研究
低代码 SaaS 案例:同一批中文问题,六种可见度结果
2026 年 6 月 15—19 日,Geolix.ai 对一个低代码 SaaS 品牌进行测试:10 道中文购买意图题,覆盖 ChatGPT、DeepSeek、豆包、Google AI Mode、Perplexity 和通义千问;每题、每天、每引擎计划重复 5 次。剔除无效运行后,共得到 1,233 条有效回答和 15,353 条引用记录。
| 引擎 | 有效回答 | 提及率 | Top-1 率 | 中文来源占比 |
|---|---|---|---|---|
| DeepSeek | 210 | 81.9% | 5.2% | 96.5% |
| 豆包 | 199 | 71.4% | 4.5% | 100.0% |
| 通义千问 | 206 | 70.9% | 34.5% | 100.0% |
| ChatGPT | 207 | 45.4% | 3.4% | 96.3% |
| Google AI Mode | 208 | 30.8% | n/a | 90.4% |
| Perplexity | 203 | 10.3% | 1.0% | 97.1% |
差距具有实际运营意义:提及率约相差 8 倍,可计算的 Top-1 推荐率从 1.0% 到 34.5%。Google AI Mode 的排名字段抽取失败,因此标为 n/a,而不是 0。逐题看,同一内容缺口还会在不同引擎中反转:有两道题在 ChatGPT 的提及率为 0,但 DeepSeek 分别为 76% 和 71%,通义千问分别为 10% 和 100%。用一个平均 GEO 分数会把这些差异全部抹平。
即使题目语言不变,引擎使用的信源生态也不同
DeepSeek 有 62.5% 的引用来自云平台和官方开发者生态;豆包有 31.1% 来自 UGC/视频来源,尤其是抖音;通义千问有 72.6% 来自 UGC/视频,另有 25.1% 为搜索自引。ChatGPT 最大的来源类别则是厂商官网,占 68.6%。这些是本案例的观察结果,不应扩写成适用于所有行业的普遍规律。
将 DeepSeek、豆包、通义千问归为中文引擎组,将 ChatGPT、Google AI Mode、Perplexity 归为西方引擎组后,两组只共享 68 个引用域名,唯一域名 Jaccard 重合度为 12%。与此同时,6 个引擎超过 90% 的引用都是中文来源。这说明中文问题会激活以中文材料为主的证据环境,但不同引擎仍会从中选择完全不同的部分。
英文金融科技案例补充了什么
另一组 Geolix.ai 数据监测了一个面向新加坡/亚太金融科技的 GEO 服务品牌。2026 年 7 月 20—31 日,9 道英文购买意图题在 ChatGPT API、Gemini 和 Perplexity 中产生 15,495 条有效回答和 223,196 条引用记录。Perplexity 的品牌提及率为 75.3%,Gemini 为 38.6%,ChatGPT 为 6.9%;三者非中文来源占比分别为 89.0%、99.9% 和 91.5%。
该案例还证明“被引用”和“被提及”不是同一指标。ChatGPT 在 22.9% 的回答中引用目标品牌官网,却只在 6.9% 的回答中写出品牌名,二者相差 3.3 倍。Perplexity 还引用了 3,149 次中文版本页面,占其同源成对页面引用的 42.5%;ChatGPT 和 Gemini 对这些中文版本的引用均为 0。即使问题是英文,不同引擎对本地化页面的处理也可能不同。
亚太金融科技团队应该怎么做
- 分别建立英文和中文的发现、比较、信任、牌照与市场准入问题库。
- 按引擎分别报告提及率、Top-1/Top-3 推荐率、自有域名被引率和第三方被引率。
- 在决定发布渠道或媒体合作前,先梳理各引擎实际引用的域名与来源类型。
- 统一不同语言版本及第三方资料中的法律实体、牌照、市场范围、费用、资格和产品限制。
- 除非控制题目、引擎、时间和其他内容动作,否则前后变化只能写成观察性结果。
- 另行增加事实准确度审查;当前 Geolix.ai 导出表没有事实准确率字段。
方法与局限
两个案例均来自生产监测,不是随机实验,且在品类、品牌、问题、日期、重复次数和可用引擎上各不相同,因此不能用汇总比例计算语言的因果影响。低代码 SaaS 案例的 DeepSeek/豆包地区字段未落库;英文金融科技案例的 Google AI Mode 计划 450 次仅成功 1 次,Google AI Overviews 仅成功 62 次,均已剔除。数据没有事实准确率字段,负面情绪计数又全部为 0,因此本文不使用这两个指标作为证据。
常见问题
这些数据是否证明中文问题一定更适合中文内容?
不能。它证明一个中文同题案例高度依赖中文来源,而且不同引擎使用的中文来源子集差异很大。若要估算语言本身的影响,仍需对同一品牌、同一问题在同一时间分别使用中英文测试。
ChatGPT 表现能否预测 DeepSeek 或通义千问?
不能安全推断。在低代码 SaaS 案例中,同一品牌和问题在提及、推荐和来源类型上都出现明显跨引擎差异。
最低限度的多语言 GEO 看板应包含什么?
需要保留问题级答案与引用网址,并按引擎、语言、地区、日期拆分;提及、推荐、自有域名引用和事实准确度必须分别计算。
参考资料
- Profound — How query language reshapes AI citations: https://www.tryprofound.com/blog/how-query-language-reshapes-ai-citations
- Peec AI — ChatGPT searches in English, even when you don't: https://peec.ai/blog/chatgpt-searches-in-english-even-when-you-don-t
- ACL 2025 — Investigating Language Preference of Multilingual RAG Systems: https://aclanthology.org/2025.findings-acl.295/
- ACL 2026 — All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG: https://aclanthology.org/2026.acl-long.338/
- ACL 2024 — Language Bias in Multilingual Information Retrieval: https://aclanthology.org/2024.mrl-1.23/
- Geolix.ai — Official website and engine coverage: https://geolix.ai/
- Geolix.ai — GEO bilingual case dataset: Geolix.ai internal production-monitoring export, anonymized, July 31, 2026.


