我们做 GEO 情报哨兵已经大半年了。每天早晨,面板上会更新一组数字:昨天各家 AI 引擎爬了哪些网站、引用了谁、把谁送进了用户的对话里。
8 月 20 日,数据师在整理这批数据时算了一笔账,算完我们几个都安静了一会儿。
Anthropic 的爬取与回访之比,是 4580:1。Google 是 5:1。
翻译成人话:Anthropic 的爬虫在你的服务器上读了 4580 次,才有可能换来 1 次真正把内容带到用户面前的回访。而 Google 的传统搜索,爬 5 次就能换来 1 次展示。
同一片互联网,两套完全不同的经济模型。

爬取是广度,引用是信任
先别急着骂爬虫浪费流量。4580:1 这个数字真正吓人的地方,在于它揭示了 AI 引擎的工作方式:
它们在「读」整个互联网,却只「引用」极少一部分。
爬取是廉价的广度——把能爬的都爬了,喂进语料和检索池。引用是昂贵的信任——每个回答只能挑几个信源摆在用户面前,挑错了,用户下次就不来了。所以引用池被压得极小、极挑剔。
第二个数字来自同一天的统计:15 个超级域名,拿走了全行业 68% 的引用。
不是 680 个域名,是 15 个。维基百科、权威行业媒体、政府与学术站点、头部大平台……AI 引擎的引用是典型的幂律分布,寡头格局,几乎没有长尾。你的内容即使被爬进了候选池,能不能被引用,取决于它是否长在 AI 引擎已经信任的那几棵树上。

这跟传统 SEO 是两套逻辑。过去,「被索引」约等于「有机会被看见」,Google 的爬取效率高,是因为它的索引本身就是展示池。AI 时代,「被爬取」和「被引用」之间隔着一道 4580:1 的漏斗,中间还夹着一道 68% 集中在 15 个域名里的信任闸门。
漏斗变了,预算也要跟着变
我们把这笔账画成了一条漏斗:
爬取 → 候选池 → 引用 → 回访
传统内容团队盯着的是第一格到第二格:内容够不够多、站内结构清不清晰、爬虫来不来。但 AI 时代的流量出口在第四格,而决定第四格的,是第三格的信任,不是第一格的数量。
这条漏斗改写了三个常识:
第一,内容数量贬值了。 一个月发 30 篇,对 AI 引用池来说可能只是 30 次爬取记录。发 3 篇能被超级信源认可的深度内容,价值反而更高。我们自己的面板上,被引用最多的从来不是日更的短讯,而是那几篇 1500 字以上、带数据带来源的长文。
第二,「自己的官网」可能连候选池都进不去。 很多企业站有反爬策略、JS 渲染、慢响应,AI 爬虫抓一次抓不动就走了——它们不是「不被信任」,是「根本没被读」。我们排查过几个客户的站,连 robots.txt 都在拦 AI 爬虫,这等于在引用经济里主动退场。
第三,信源地位可以主动争取。 这也是我们把这笔账算完之后,把「超级信源布局」定为 P0 的原因。既然引用是幂律的,与其孤零零等自己的域名被选中,不如去占那些 AI 引擎已经信任的位置——行业媒体、词条、榜单、第三方评测、高权重问答平台。内容在哪儿被引用不重要,重要的是它出现在 AI 引擎的引用池里。
一个可以带走的检查表
如果你也想算算自己在这条漏斗里的位置,可以按下面四步自查:
- 你的站被爬了吗? 翻服务器日志,搜 Anthropic、GPTBot、PerplexityBot 这些 UA。一个都没有,先解决可爬取:robots 放开、提速、上结构化数据。这是入场券。
- 你出现在候选池了吗? 在 ChatGPT、Perplexity 里搜「你的品牌 + 品类词」,看 AI 提不提到你。不提,说明你连候选池都没进。
- 你被引用了吗? 用引用追踪工具或 GEO 面板看近 30 天被引用次数。注意 8 月 18 日我们写过的坑:追踪工具普遍少计 20%-40%,别被面板骗了。
- 你的信源位置在哪? 列一张表:你的品类里,AI 引擎常引用的 15 个域名是哪些?你在这 15 个位置里有没有内容、有没有被它们引用?没有,这就是接下来三个月的功课。
做完这四步,大多数团队会发现自己停在第一格和第二格之间,而流量早就从第四格流走了。

4580:1 是 AI 引擎的账,不是你的账。你的任务是让自己的内容,从第 4579 次爬取里活下来。