一个看似聪明的决定
不少站长在后台加了一条规则,把 GPTBot、ClaudeBot、Bytespider 这类名字的爬虫全部拦在门外,心里想的是:我的原创文章凭什么免费喂给别人的模型?这种保护欲完全能理解。但很多人没意识到,这些被你挡掉的抓取程序,恰恰也是今天各类答案引擎取内容、组回答的来源。你以为守住了内容,实际上守掉的是在 AI 回答里被点名的机会。当用户越来越习惯直接问对话式工具"哪家靠谱""怎么选",而不是翻蓝色链接时,你在这条新入口上的缺席,比丢掉几个排名更隐蔽,也更难察觉。
爬虫分两种:喂模型和取答案
要把这件事说清楚,得先分清两类抓取。一类是训练型爬虫,目标是把网页内容收进大模型底层的语料;另一类是检索型、回答型爬虫,它们不在训练阶段干活,而是在用户提问的当下,实时去网页里找一段能直接放进答案的原文。后一类才是和"你的内容会不会出现在回答里"直接挂钩的角色。像 Bing 的 Copilot、Perplexity、Google 的 AI 概览,以及国内的文心、通义在生成答案时依赖的检索链路,都靠这些爬虫把你的页面读进去。一刀切把爬虫关掉,训练型和回答型一起拒之门外,结果往往就是:你既没少被训练多少,反而先丢掉了被引用的资格。当用户问"本地做这块谁比较专业",引擎本来可以从你的案例页摘一句实打实的说法,现在只能去引竞品,因为这边根本读不到你。
三招判断你是不是已经中招
第一招,打开根目录的 robots协议 文件,看 Disallow 后面跟着的是不是 GPTBot、CCBot、ClaudeBot、Bytespider、PerplexityBot 这类名字,或者干脆是一句 Disallow: / 把全站都封了。第二招,换个 AI 工具搜你自己的品牌名或核心业务,看它给出的回答里有没有引用你、有没有提到你家的产品。第三招,去搜索引擎站长平台看索引情况,如果你的页面在常规搜索里都很少出现,那在答案引擎里基本也没戏。三招里只要中了一招,就该重新评估那条拦截规则了。很多人是当年为了"防采集"随手加的,早忘了自己写过什么,等到发现流量结构变了才回头查。
马上能做的三件事
先把"训练"和"回答"分开对待。对纯粹做训练用途的爬虫,你可以按自己的取舍更保守一些;但对负责检索和回答的爬虫,建议放行,因为它们直接决定你能不能被答案引擎引用。其次,别再用 Disallow: / 这种全站封杀,改成精准到具体路径的白名单式放行,只把真正不希望被抓的后台、会员区、测试页挡住,前台内容全部敞开。最后,把你最想被引的页面——关于我们、产品介绍、案例展示——确认对抓取程序完全开放,并补上对应的结构化数据,让机器一眼能认出这是谁、卖什么、有什么资质,而不是只看到一堆没标注的图文。
放行之后,怎么让内容真的被引
开放抓取只是第一步,内容本身得"好搬"。首段就给结论,别让机器翻到第三节才找到答案;把关键事实写成一小块能整段搬走的文字,比堆一整屏铺垫更有用;在涉及数据、标准、法规的地方链到权威来源,提升可信度;同主题的文章互相递话、交叉引用,让模型看到你在这个领域是成体系的,而不是只有孤零零一篇。对一家想做 geo优化公司 来说,被 AI 回答稳定引用,本身就是比关键词排名更靠前的流量入口,因为用户问的已经是意图,不再是关键词。
写在最后
把爬虫关掉那一刻,你以为保护的是内容,其实悄悄关掉的是网站收录和品牌出现在答案里的通道。robots协议 该管的是隐私和成本,不是把取答案的机器挡在门外。下一次改 robots 之前,先想清楚:你究竟是不想被训练,还是不想被看见——这两件事,代价完全不同。内容被引用这件事,从来不是靠藏起来赢的,而是靠被读得到、读得懂、读得信。