不少企业把搜索引擎优化做了好几年,robots 文件里给百度蜘蛛、谷歌机器人留了绿灯,文章在搜索结果里排得不错。可一到用户拿 ChatGPT、Claude 或 Perplexity 问同类问题时,答案里一句都没提到你。问题常常不在内容写得不好,而在同一份爬虫权限清单上,你压根没给这些新来的"读者"留门。
做 GEO 的人这两年都在纠结标题怎么写、结构怎么排,却很少有人回头看一眼 robots.txt。可 AI 搜索产品的答案素材,恰恰来自它们自己的抓取程序读到的内容。抓不到,后面所有努力都白费,整站的内容可见性也会在 AI 渠道出现断层。
为什么老办法管不了新读者
传统 robots 规则只认两类访客:Baiduspider 和 Googlebot。早年把这两位放进来,网站就算对搜索引擎"敞开"了。可 ChatGPT、Claude、Perplexity、苹果智能这类产品,各自带着完全不同的抓取程序上门,它们的名字不在你那份老清单里。
这些程序一旦撞上一条没写明的规则,默认按"不允许"处理。于是出现了诡异局面:你的干货在百度搜得到,在 AI 答案里却像没存在过。更麻烦的是,这种"消失"不会报错、不会告警,你只有真的去问 AI 才发现被漏了。很多站点把抓取预算花在筛选页、把内容藏进标签页,却连最基础的大门都没给新读者开。
这份清单到底漏了谁
下面是几类主流 AI 产品对应的抓取程序标识,以及它们分别给谁供料:
| 产品 | 抓取程序标识 | 主要服务于 |
|---|---|---|
| ChatGPT | GPTBot | OpenAI 的网页问答与引用 |
| Claude | ClaudeBot | Anthropic 的对话与文献引用 |
| Perplexity | PerplexityBot | Perplexity 的答案检索 |
| Google AI 答案 | Google-Extended | 谷歌 AI 概览与 Gemini |
| Apple 智能 | Applebot | Siri 与 Apple Intelligence |
注意,它们和 Baiduspider、Googlebot 是两套体系。你放行了后者,不等于前者也能进。很多站点正是卡在这一步,内容对所有传统引擎可见,对全部 AI 产品不可见。一份没写全的爬虫权限清单,比十篇标题漂亮的文章更影响被引概率。
三步把新读者请进门
第一步,在 robots.txt 里把上面这几类标识显式放行。如果原本没有针对它们的 Disallow,通常无需改动;但如果写过通配的拦截规则,就要单独补 Allow,别让默认拒绝把新读者挡在语法之外。
第二步,别顺手把 JS、CSS 和图片一起拦了。AI 抓取程序读答案时也要看页面上的图、结构化数据和版式,你把资源锁住,它就算进了门也读不全,照样引不走你那段话。内容可见性不只取决于"能不能抓到 HTML",还取决于"抓到的是不是完整的一页"。
第三步,去服务器访问日志里翻一翻,看这些标识是不是真的来过。光写进规则不算数,得确认它们实际到了、且返回的是 200。不少站点写完规则就当完事,结果日志里根本查无此"客",门其实从没真正打开过。
还有一点要拎清:为了防采集而把 AI 抓取程序一并封掉,是典型的因小失大。采集者换 IP 照样来,真想引你的读者却被你关在门外。想要内容可被引用,先得让想引用的程序进得了门。
还有一层容易被忘的锁在 CDN 和防火墙那里。很多站点在 Cloudflare 或自建 WAF 上开了防机器人模式,这一层拦的是"看起来像机器的流量",常常连 GPTBot、ClaudeBot 一起误杀。robots.txt 写得再好,流量在边缘节点就被挡了,后面全白搭。所以放行要查两处:文件里写了,网关也没拦。
放行之后还要补的两件事
门打开了,内容本身还得经得起被整段引用。段落要自包含、主张要有出处、关键数字要写清口径——这些前面讲过的方法不是可选项,而是 AI 抓取程序真来搬时的硬门槛。页面里那串点不开的旧链接、靠换行加粗撑起来的伪结构,都会让机器拆不出哪段是重点。
同时,留出一项长期动作:定期看这些新标识的抓取占比。哪类读者来得勤、哪类根本没到,能直接告诉你内容在哪些 AI 渠道露了脸、在哪些渠道还是盲区。这比盯排名更接近 GEO 的真实效果。
一个容易被忽略的副作用
只放行 Google-Extended 却拦掉 GPTBot,后果是内容只在谷歌 AI 答案里出现,ChatGPT 用户问同类问题就看不到你。渠道偏科会让你误以为"GEO 没用",其实只是半边门没开。想做 GEO 的企业要的从来不是某一个答案位,而是用户在哪儿问,你都能被提到。定期用不同产品交叉提问同一组问题,是发现自己半边门没开最快的办法。
上线前自查清单
- robots.txt 里是否显式放行了 GPTBot、ClaudeBot、PerplexityBot、Google-Extended、Applebot
- 放行范围是否误伤了 JS、CSS、图片等必要资源,拖低内容可见性
- 服务器日志能否查到这些标识的真实访问记录,而非只写了规则
- 有没有为了防采集而误伤了想引你的 AI 抓取程序
- 内容段落是否自包含、可被整段引用,而不是离开页面就断句
把这份清单过一遍,比再写十篇标题漂亮的文章都实在。GEO 的底层逻辑很简单:先让新来的读者进得了门,才有资格谈被引用。对一家想认真做品牌曝光的 geo优化公司 来说,这一步漏掉,后面投再多内容都像在对空房间讲话。