原创

robots.txt 里那行 Disallow,可能正把引用你的爬虫关在门外

GEO优化编辑部 3 阅读

robots.txt里那行Disallow,可能正把引用你的爬虫关在门外很多站长把robots.txt当成"省带宽"的开关,看到抓取日志里冒出陌生的UA就顺手加一条Disallow。等到发现自己的内容从没出现在任何对话式回答里,才回头去查—...

很多站长把 robots.txt 当成"省带宽"的开关,看到抓取日志里冒出陌生的 UA 就顺手加一条 Disallow。等到发现自己的内容从没出现在任何对话式回答里,才回头去查——问题往往就出在那一行规则上。今天要聊的,正是容易被忽略的一环:你用来挡垃圾蜘蛛的配置,可能连带着把那些决定你能否被写进答案的爬虫一起挡掉了。

为什么答案引擎的爬虫和搜索蜘蛛不是一回事

传统 SEO 里我们熟悉的是 Baiduspider、Googlebot,它们决定你在搜索结果里的排位。而当下做 GEO优化,真正把你的内容搬进对话回答的,是另一批爬虫:OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、Google 针对生成式摘要启用的 Google-Extended,以及 Bing 背后的抓取体系。它们各自有独立的 UA 和抓取策略,绝大多数并不在老一套的 robots 规则覆盖范围内。

不少站点为了"防采集"或"减负",写了一条 User-agent: * 配 Disallow: /,本意是拦掉杂牌蜘蛛,结果把上面这批爬虫也一并拒之门外。等到别人在 AI搜索 里问到你的行业,引擎想引用你却抓不到正文,只能转去摘竞争对手——你连参赛资格都没拿到。

自检:你的 robots 到底放走了谁

最省事的办法,是打开根目录的 robots.txt,逐行看 Disallow 指向的路径,再对照三类爬虫的 UA 名单:

  • 内容型:GPTBot、ClaudeBot、Google-Extended、OmgiliBot、Diffbot
  • 通用型:* 下的 Allow 是否覆盖了正文目录
  • 风险型:凡是把整站或 /、/article/、/blog/ 这类正文区 Disallow 掉的,基本都该改

重点看"通配符"那几行。很多模板站为了省事,直接 Disallow: / 配 User-agent: *,这种写法对品牌曝光 的伤害是隐形的:你肉眼看站点一切正常,但引擎那一侧早就收不到你了。

正确写法:放行内容,只护住后台

原则很简单——正文目录全部 Allow,只把真正不该被抓的后台、模板、临时文件挡住。以本站为例,后台 Disallow: /admin/、/tools/、/temp/、/includes/,其余一律放行。这样既能控制抓取预算,又不误伤内容抓取。

如果你确实需要限制某些 AI 爬虫,不要整站 Disallow,而是单独点名。例如只想禁止某一家:写 User-agent: GPTBot 再 Disallow: /,其余保持 Allow。这种"精准点名"的好处是,你把控制权留在自己手里,而不是一刀切把所有引用率 来源都关掉。

改完之后,务必用各平台的 robots 校验工具复测一遍,确认正文路径返回 Allow。别凭感觉,实测才作数。一个常被忽略的细节:别只盯百度站长平台,Bing Webmaster 的 Robots 测试工具也要跑一遍,因为答案引擎的抓取链路由 Bing 主导,那边放行了,GPTBot、ClaudeBot 才更容易沿着同一条路径拿到正文。

可直接照抄的放行模板

如果不确定怎么写,下面这一份对大多数内容站都安全,直接放到根目录即可:

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /tools/
Disallow: /temp/
Disallow: /includes/
Disallow: /*?s=
Disallow: /*?keyword=

Sitemap: ../../sitemap.xml

要点只有两条:正文区一律 Allow,后台与搜索参数一律 Disallow。末尾那行 Sitemap 告诉引擎去哪拿全量链接,比一条条推送更省事,也避免漏链。

除了 robots,还有三道隐形的门

即便 robots 放开了,下面三处仍可能让爬虫空手而归:

第一,脚本渲染的空壳。正文靠前端 JS 拼出来,首屏 HTML 里没有文字,爬虫收走的只是壳。关键结论和定义要写进服务端直出的 HTML。

第二,登录或付费墙。把核心内容锁在登录之后,引擎自然抓不到,也就无从引用。需要被引用的内容应放在公开可读区域。

第三,误加的 noindex。有些模板默认给内页挂了 noindex 或 nofollow,本想控重复,却把正文也压住了。上线前用抓取工具看一眼源码里的 meta 标签。

放行之后,还得让爬虫"搬得走"

robots 只是第一道门。就算放开了,引擎能不能引用你,还取决于内容本身是否"可被整段摘走":首屏 HTML 是否真有文字、关键结论是否在前 150 字、是否有清晰的小标题层级、证据是否落得了地。很多站点门开了,正文却是一堆脚本渲染的空壳,爬虫进来也只收个壳。

所以真正决定被引用概率的,是"放行 + 可被摘取"两件事同时成立。只改 robots 不补内容,等于把门打开却屋里没货;只写内容不放开行,等于货在屋里却上着锁。

多久能看到变化

robots 改动是即时生效的,但爬虫重新来访有周期,通常几天到一两周。判断有没有效果,别只看流量,要看"被引用"这件事本身:在对话里直接问你的行业问题,看回答是否出现你的表述、你的站名、你的数据。出现,说明门真正开了;没出现,再回头查 robots 之外的拦路点。

常见问题

放行 GPTBot 会不会让内容被白嫖? 爬虫抓取不等于免费授权。你照常保留版权与署名,引擎引用时通常会带来源链接,这反而是品牌曝光 的机会。真正怕白嫖,应该用授权声明而非整站封锁。

只想让百度收录、不想进 AI 回答,能分开控制吗? 能。百度走 Baiduspider,AI 回答走 GPTBot、ClaudeBot 等,分 UA 写规则即可各管各的。

改了 robots 还要重新提交链接吗? 建议提交一次,让爬虫尽快回访。链接提交本身不保证收录,但能缩短等待。

结论

robots.txt 不是越严越好。把决定你能否被写进答案的爬虫挡在门外,是很多站点做了 GEO优化 却没声量的隐性原因。逐行核对 Disallow,放行正文、点名后台,再配合可被摘取的内容,门才真正为你打开。顺手把 robots.txt 加进每次上线的检查清单,比事后反复排查"为什么没被引用"省事得多。

相关推荐

GEO优化

更新了大半年没见被引用?这 6 个信号比阅读量更能说明问题

更新了大半年没见被引用?这6个信号比阅读量更能说明问题很多团队内容更新了大半年,后台阅读量、访客数都在缓慢爬升,可真去几个AI搜索里问"帮我推荐一家做XX的",出来的答案里始终没有自家官网。不是发得不

GEO优化

页面里标了五星好评,正文却一条都拿不出:机器核对后整页不再信你

页面里标了五星好评,正文却一条都拿不出:机器核对后整页不再信你不少企业做内容时都装了SEO插件,后台一键给页面打上评分、库存、问答这些结构化数据,以为这样就能被答案引擎优先整段引用。想法没错,但很多人

GEO优化

满页都在说"能搞定",却没写"得先有啥",机器只当你在喊口号

满页都在说"能搞定",却没写"得先有啥",机器只当你在喊口号做内容时有个很常见的惯性:把产品、服务、方案往好了写,能不提前提就不提,能不写代价就不写。页面读起来顺,转化词也到位,可一轮轮发下来,用户去

GEO优化

首屏 HTML 空着,来抓答案的引擎只收了个壳

首屏HTML空着,来抓答案的引擎只收了个壳很多企业做内容时都有一个错觉:页面在浏览器里明明能看、能点、能读,就以为搜索引擎和答案引擎也"看"到了同样的东西。实际情况常常相反——你引以为傲的那篇干货,在