人类读文章是线性的:从头到尾,在脑子里建立理解。AI 处理内容的方式完全不同——它把页面切分为可独立成立的语义单元,判断每个单元里有没有可回答用户问题的事实,然后抽取出来重新组织成答案。这意味着两件事:
基于这个前提,我们在实际项目中观察到四个比较稳定的偏好。它们不是平台公布的规则,而是从「什么样的内容被引用了」反向归纳出来的特征。
当用户问「××公司是做什么的」或「什么是××服务」时,AI 需要一句现成的、准确的表述。如果页面的开头就提供了这样一句话,被采用的成本就降到了最低;如果没有,AI 只能从整页内容里自己拼凑,而拼凑的结果往往不准确。
对比两种写法:
| 不容易被引用的写法 | 容易被引用的写法 |
|---|---|
| 「深耕行业多年,我们始终坚持以客户为中心,用专业与匠心服务每一位合作伙伴……」(全文没有一句说明具体做什么) | 「××公司是一家专注××领域的产品制造商,成立于××年,主营××、××两类产品,服务××行业的××类客户。」 |
| 「作为行业的领跑者,我们拥有强大的技术实力和丰富的项目经验。」 | 「公司现有××名员工,其中研发人员××名;拥有××项专利,年产能力××台套。」 |
判断标准很简单:把这一句单独拿出来,放到任何地方,能不能独立说明白「这是什么」。能,就是合格的定义句。
AI 在决定是否采信一个数据时,会做交叉核验。一个没有来源的数字,对它来说是高风险信息——可能是错的,可能是过时的,也可能只是营销修辞。因此我们建议所有关键数据都以「四件套」形式出现:
具体到可核对的精度。
这个数字是怎么统计的、算的是什么。
数据对应的时间范围,避免过时信息被当作现状引用。
数据出处,是内部统计、第三方报告还是公开资料。
AI 能安全引用,你也经得起追问。
举个实际例子。「服务客户 1 万家」和「截至 2026 年 6 月,累计服务客户超过 1 万家(含多年度续约客户,数据来源:公司 CRM 系统统计)」——后者看起来啰嗦,但它是 AI 敢用的表述。而前者在被核验时,AI 找不到任何佐证,大概率直接跳过。
结构的作用是告诉 AI「这一段在回答哪个问题」。我们建议的最小结构单元是三级:
AI 在回答涉及具体企业的问题时,会做「实体核验」:这家公司是否存在、叫什么名字、在哪里、做什么业务、信息是否前后一致。任何一处对不上,都会降低整站内容的可信权重。需要保持一致的信息包括:
这些信息建议以结构化数据(schema.org 的 Organization)在页面上标注,同时保证页面上的人类可读版本与结构化版本完全一致。
被引用与不被引用之间,还有一类更糟的情况——被判为广告内容,从而在候选阶段就被降权。我们观察到的特征包括:
| 特征 | 为什么会被判为广告 |
|---|---|
| 联系方式在正文中高频出现 | 正常信息型内容的电话出现在导航与页脚;正文反复出现电话与「立即咨询」,是促销页的典型特征 |
| 绝对化用语密集 | 「唯一」「第一」「最专业」这类无法验证的表述,本身也不符合广告法要求 |
| 数据无来源、无口径 | 无法核验的数据与营销修辞难以区分 |
| 无作者署名、无更新日期 | 缺少责任主体与时效信息,AI 无法判断内容是否仍然有效 |
| 同一内容在多个 URL 重复 | 重复内容会稀释权重,AI 难以判断哪个是权威版本 |
这八条都不涉及技术实现,属于内容层面的基础规范。先从这八条做起,比急着追求内容数量更有价值。