不少站长在后台看到"某 AI 公司的爬虫一天访问几千次",第一反应是怕内容被白嫖去训练模型,于是在 robots.txt 里加一条 Disallow,把所有陌生 UA 全拦了。搜索排名短期没怎么变,可半年后你发现:用户用豆包、元宝问产品相关问题时,跳出来的答案里根本没有你,被整段引用的反而是竞品。问题往往就出在那条图省事的规则上。
拦之前,先看清它到底来干嘛
抓取机器人不是一个整体,得拆开看。一类是传统搜索爬虫,比如 Googlebot、百度的 Baiduspider,它们决定你在不搜结果里的排位;另一类是生成式答案爬虫,像 GPTBot、Google-Extended、ClaudeBot,以及字节的 Bytespider、豆包和 DeepSeek 的抓取程序,它们把网页内容读进大模型,用来在回答里引用。你想要的"被 AI 提到",靠的正是第二类。用一条 Disallow 把两类全堵死,搜索那位或许还能从旧缓存里捞你,答案那位就彻底进不来了。
一刀切拦掉的,是你的答案占位权
答案引擎挑选引用对象时,第一步就是能不能稳定抓到你的页面。如果 robots 直接拒绝,它连内容都不读,自然不会把你写进回答。你省下了"训练数据被用"的顾虑,代价却是整块 AI 场景下的内容可见性归零——用户在对话里问到你这个行业,得到的答案里永远没有你的名字。对一家想把 geo优化公司 服务做起来的企业来说,这等于主动放弃了眼下增长最快的入口。
给机器人分三档对待
与其全拦,不如按意图分别开门。下面是一份可直接参照的 robots.txt 思路:
User-agent: Googlebot
Allow: /
User-agent: Baiduspider
Allow: /
User-agent: GPTBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Bytespider
Allow: /
如果确实不想让内容进通用训练集、又希望被答案引用,可以只拒绝明显"只采不引"的采集器,保留答案爬虫。关键是别用一条通配规则把所有人挡掉。每加一条 Deny,先问一句:这条会误伤可被引用的抓取机器人 吗?
三个最容易误伤的场景
第一种,只认 UA 关键字就封。有些防火墙看到"bot"就拦,结果把 Google-Extended、ClaudeBot 一起干掉,你却毫无察觉。第二种,CDN 层另有一条隐藏规则。站点主以为 robots 放行了,其实边缘节点还在返回 403,机器人拿到的是拦截页。第三种,把整站 Disallow 当"防盗"用。短期看似安全,长期是把自己的内容从所有答案引擎 的候选池里抹掉。
放行之后,还要补两件事
第一,去服务器日志确认这些 UA 真的来过、且拿到的是 200 而非拦截页。第二,确保被抓的页面是真实静态页、文字在源码里就存在,否则机器人来了也读不到可被引用的正文。做到这两点,你的内容才真正开始进入答案的候选池,后续配合清晰的小标题和自成一体的段落,被整段搬走的概率会明显高起来。
内容打磨得再好,机器人进不来也是白搭。把抓取器管理从"一刀切"换成"分档对待",是 2026 年做内容曝光最划算的一次配置调整。