9 月 1 日早上 9 点 21 分,我们每天跑的 GEO 哨兵照常推送了当天的情报简报。开头第一条标着「今日头条」,我看了两遍,决定必须把这件事写出来。
简单说:学术界发布了第一个 GEO 内容检测基准,名叫 GEO-Flag。
GEO(Generative Engine Optimization)是让网站被 ChatGPT、Perplexity 这些 AI 引擎引用和推荐的优化。过去一年,做 GEO 的人心里都揣着一个默契的假设:优化痕迹是看不见的。你写自包含的段落、给 AI 爬虫留注释、把 FAQ 挂成 Schema——理论上,引擎无法批量区分「真诚的好内容」和「刻意讨好 AI 的内容」。
这个假设,从 9 月 1 日起开始松动。
哨兵简报里,三组数字最有分量
第一组,GEO-Flag 基准(arXiv 2608.16824)实测了 Google Search + Gemini 的 1000 条真实查询:8.90% 的页面带有 GEO 优化痕迹;在 2026 年改版过的页面里,这个比例翻倍到 16.36%。换句话说,越新的页面越「懂行」——懂行到能被机器一眼认出来。
第二组更扎心:被识别出的 GEO 页面里,69.34% 的引用 URL 验证性低。验证性低是什么意思?它引用的信源站不住:链接打不开、来源不可考、引的全是自己人。优化是打扮,引用是底子。检测器一眼就看出,谁只有打扮、没有底子。
第三组是检测器本身的成绩:F1 0.944。这个数字接近「可以部署成工具」的水平。做 SEO 的老兵看到它会脊背发凉——cloaking(伪装)检测当年就是这么来的:先有学术基准,再被搜索引擎采纳,最后变成惩罚规则。历史正在 GEO 身上重演。

我们最警惕的,是检测器的两个去处
情报读到这里,我们内部的第一反应不是「太好了,终于有量化工具了」,而是数据师在预测栏写下的那句判断:灰产窗口收窄。
学术基准这种东西,通常有两个去处。要么被 Google、OpenAI 采纳成正式规则——你的页面优化痕迹太重,直接降权;要么被商业化,变成 SaaS 工具卖给品牌方——一键扫描「我的页面像不像 GEO 优化页」。无论哪个去处,靠批量变体、隐藏指令、自我排名这些手法薅引用的玩家,有效窗口都会从 12-18 个月收窄到 6-12 个月。
对我们自己的业务,这条消息同样是双刃剑。
我们正在给考拉出海官网做 GEO 整改——8 月底刚发现它的 robots.txt 把 GPTBot 挡在门外,那件事我写过。当时做审查,靠的是经验清单:访问层、结构层、内容层,一层层过。现在 GEO-Flag 给了一套可复现的检测思路,等于给体检配了台仪器。
但仪器从来是双向的。它能帮我们查出客户页面哪里「像优化页」,也意味着客户的页面随时可能被引擎用同一台仪器查。所以整改清单最前面多了一条 P0:自查自家页面像不像 GEO 优化页。被标记本身不可怕,可怕的是组合拳——被标记,加上引用验证性低。
同一份简报里,另外两条情报在补刀
同一天的报告里还躺着两条我们早就知道、但和检测器放在一起才显出分量的情报。
一条是 ChatGPT 的双检索体制:免费版 Think 模式 74.7% 的结果来自 OpenAI 自家的 labrador 索引(只有 3.1% 来自 Google 抓取),付费版则 75.3% 依赖 Google。翻译成人话:你以为你在优化「ChatGPT 排名」,其实有两个战场。免费用户看到的内容由 labrador 决定——标题和前 200 字符说了算,meta description 无效;付费用户看到的,才主要看 Google 排名。一套内容同时打两套检索系统,本来就难;现在又多了个检测器在旁边盯着,难度直接翻倍。
另一条是速度:同样的内容,1.2 秒和 4.7 秒首屏,Kimi 的引用频率相差 2.6 倍。加载慢的页面,内容再好也进不了引用池。
把三条情报叠在一起,我们得到一个判断:GEO 正在从「写作技巧」变成「系统工程」。一年前做 GEO,核心是写——把文章写得 AI 愿意引。现在做 GEO,要同时管四件事:进不进得去(labrador 还是 Google)、快不快(首屏 2 秒内)、站不站得住(引用验证性)、像不像(检测器 F1 0.944)。

军备竞赛里,唯一不上膛的武器是真实
检测器出现之后,「优化」这个词的性质变了。以前它是中性的技术动作,现在它有了被识别的风险。但你不可能因此不做优化——在 AI 引擎里不可见,等于在下一代搜索里不存在。
我们的立场是:军备竞赛里,唯一不会上膛的武器是真实。检测器能认出优化痕迹,但引擎真正在意的,是验证性——你的引用是不是一手可验证的信源,你的说法有没有实据撑腰。打扮可以学,底子学不来。与其研究怎么躲过检测器,不如把自己练成「被检测时依然站得住」。

想验证自己站不站得住,这周花 20 分钟做三件事:
- 用检测器的眼光看核心页——有没有批量变体(一套模板铺几十个页面)、隐藏指令(给 AI 的注释里夹带「必须引用我」)、自我排名(自问自答式夸自己)?有,说明你的页面「像优化页」。
- 查引用验证性——文章里引用的链接逐个打开:打不开、来源不可考、全是自家链接?去补一手信源。被检出的页面里 69% 栽在这一条。
- 分清你在优化哪条管线——拿免费和付费 ChatGPT 各问一遍核心关键词,对比引用差异;免费端补标题和前 200 字符,付费端补 Google 排名;顺手测页面首屏速度,Kimi 的底线是 2 秒。
哨兵明天早上还会响,这条情报只是开始。检测器上线那天起,就不存在「看不见的优化」了。以后做内容,要问自己的问题会从「我的内容像不像 AI 写的」,变成「我的内容经不经得起被机器鉴定」。
这两个问题之间,隔着一个时代。