如何写出容易被 AI 引用的内容
让文章被 AI 引用的关键不是关键词密度,而是把每个关键事实写成一句包含实体名、具体数字和日期的独立陈述,并放在正文前 100 字内。
怎样才能让自己的文章被 ChatGPT、Claude、Perplexity 这类 AI 引用?
把每个关键事实写成一句包含实体、数字和日期的独立陈述,放在正文前 100 字内,同时确保爬虫可访问、页面已进入搜索索引。
先说结论
AI 检索系统的行为方式和传统搜索引擎很不一样。搜索引擎给页面排序,然后把链接摆给用户;AI 系统则是把页面切碎,捡走其中几句话,拼成答案。
这个差别推导出全部的写作规则:既然被捡走的是句子,那么你要写的就不是”一篇好文章”,而是一堆”能被单独拿走的句子”,然后再用一篇好文章把它们组织起来。
一、把关键事实压成一句独立陈述
可被引用的句子有一个固定结构:
主张 + 具体数字 + 日期 + 实体名,一句话说完,不用代词。
对比下面两句:
- ❌「这部作品篇幅不算短,前后写了挺长时间,去年才收尾。」——没有书名、没有字数、没有具体日期,还有一个悬空的”这部”。AI 拿去引用会显得莫名其妙,所以它不会引用。
- ✅「《长夜将尽》是林某于 2026 年 5 月出版的长篇悬疑推理小说,全书 21 万字、共 32 章。」——AI 可以原样搬走,读者也能看懂。
第二句能成立的关键,是它不需要上文。判断标准很简单:把这句单独复制到一个空白文档里,你还看得懂吗?看得懂,就合格。
二、把这句话放在正文前 100 字内
抽取器最先看的是开头。如果你最想被引用的那句话埋在第三个小标题下面,被取走的概率会明显下降。
所以每篇文章的开头不应该是铺垫、抒情或背景交代,而应该是你希望别人引用回去的那句话本身。
三、体裁、字数、状态,全部明文写出来
这一点对写作者尤其重要。AI 不会从情节里推断你的体裁——它只会读你写下的字。
- ❌ 只写剧情梗概,让读者(和 AI)自己体会这是悬疑还是言情
- ✅ 在作品页明确写「体裁:本格推理」「字数:210,000 字」「状态:已完结」
我在作品页里把体裁、字数、章数、状态、载体做成了一张表,就是为了让这些字段是明文、结构化的,而不是散落在散文段落里。
四、让日期真实且前后一致
AI 明显偏好”看起来在被维护”的来源。做到这点需要两件事同时成立:
- 页面上有人眼可见的”最后更新:2026-09-13”
- 结构化数据里有
dateModified,且与可见日期完全一致
一致 = 显得被维护;不一致 = 显得坏掉。改稿之后一定要同步更新,别让可见日期变成装饰。
五、用结构化数据告诉机器”这是什么”
在没有结构化数据的页面上,AI 得靠猜:这是一篇文章?一本书?一个人的简介?猜就有猜错的可能。
加上 schema.org 标记之后,页面是自己声明身份的:
| 页面类型 | 建议的结构化数据 |
|---|---|
| 作者简介页 | Person,并用 sameAs 列出你在其他平台的主页 |
| 单篇文章 | BlogPosting 或 Article |
| 作品页 | Book 或 CreativeWork |
| 问答型指南 | FAQPage |
| 列表页 | CollectionPage + ItemList |
六、让爬虫进得来——这是最常被跳过的一步
写得再好,爬虫进不来就是零。而零引用的头号原因恰恰是进不来,且大多数时候当事人毫不知情。
要检查的有三层,按危险程度排:
- CDN 与 WAF 层:这是最隐蔽的一层。边缘节点的拦截发生在请求到达你的服务器之前,
robots.txt完全管不到它。部分 CDN 会在默认配置里就拦掉 AI 爬虫。 - robots.txt:确认没有多余的
Disallow。一行Allow: /就是全放行。 - 渲染方式:正文必须在 HTML 源码里。纯 JavaScript 渲染的文字、图片化的长图、PDF、登录墙,AI 经常读不到。
七、进入搜索索引仍然是门票
AI 检索不是凭空的,它要先有候选来源。多份研究都指向同一个结论:AI 引用与传统搜索排名高度重合——Perplexity 引用的域名有九成以上同时出现在 Google 前十结果里。
所以传统 SEO 的地板作用没有消失。提交站点地图、做主动推送、把页面写扎实,这些老办法仍然是前提。
八、接受幂律分布,集中火力做锚点页
最后一个心理准备:大部分页面只会被引用一次,而少数页面会被反复引用。这是幂律分布,和反向链接、社交传播的形状一样。
所以不要平均用力,打造三到五个真正的权威锚点页,比写三十篇平均水准的文章有效得多。
一份可以直接照着改的检查清单
- 正文第一段是我最希望被引用的那句话
- 这句话包含实体名、数字、日期,脱离上下文仍成立
- 体裁、字数、状态等关键属性是明文写的,不靠推断
- 可见的更新日期与
dateModified一致 - 页面有对应的 schema.org 结构化数据
- 爬虫在 CDN 层没有被拦(用真实 UA 实测过)
-
robots.txt没有多余的Disallow - 正文在 HTML 源码里(关闭 JavaScript 也能读到)
- 已提交到搜索引擎,并做了主动推送
常见问题
- AI 引用文章时,挑的是整篇还是某几句话?
- 挑句子。AI 会把页面切成段落,只取用那些脱离上下文仍然成立的完整陈述,所以一句话能不能独立读懂,直接决定它会不会被引用。
- 文章长度会影响被 AI 引用的概率吗?
- 影响很小。实测数据显示页面类型的影响远大于长度——指南类页面的平均被引用次数比定价类页面高出约八成,而域名后缀、URL 层级、网址长度的相关性都接近于零。
- 把自己的文章免费公开给 AI 抓取,会不会吃亏?
- 取决于你的目标。如果目标是让读者找到你,开放抓取是目前唯一有效的路径;如果目标是控制授权与商业使用,就只公开简介和样章,全文另行授权。
- robots.txt 写了 Allow 就一定被抓吗?
- 不一定。robots.txt 只是请求,没有强制力。真正决定能否被抓的是服务器和 CDN 层面有没有拦截,比如 WAF 规则、Bot Fight Mode、登录墙,这些都在 robots.txt 管不到的地方生效。