想确认机器读没读你的页,访问日志是唯一的一手证据
做 GEO 优化的团队最常卡在一个地方:内容发了半年,不知道机器究竟来过没有。站长平台看不到生成式引擎的抓取明细,AI 搜索的问答界面也不会告诉你它读了哪一页,判断只能靠感觉。但服务器的访问日志其实把一切都记下来了——哪个爬虫标识来过、请求了哪条路径、返回什么状态码、隔多久回访一次,全是原始记录。放着日志不翻,等于监控录像摆在那里没人看。
抓取、收录、被引用是三件事,别混着谈
很多人一看日志里有抓取记录就松了口气,这个判断太早。三件事要分开:抓取记录说明机器请求过这个 URL;收录说明内容进了索引库;被引用说明生成答案时挑中了你这段。前者是后两者的必要条件,不是充分条件。反过来看更有用:如果日志里连抓取记录都没有,后面两步根本无从谈起,此时再改标题、加内链都是白费力气。所以核验顺序永远是先看有没有被读到,再谈质量。
动手前先备好爬虫标识清单
日志里的信息量很大,没有清单就会看花眼。把关注的爬虫标识列成一张表,按两类分:
一类是生成式引擎的抓取器,常见的有 GPTBot、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended,以及国内引擎的抓取与渲染 UA。另一类是传统搜索引擎爬虫,Baiduspider、Bingbot、Sogou、360Spider 属于这一档,它们的抓取结果同样会流向问答型产品,不能只盯着新面孔。
清单里还要留一栏"是否已核验来源"。UA 字符串可以随便伪造,市面上大量采集程序会挂着 GPTBot 的名号来扒内容。判断方法是对请求 IP 做反向解析,看域名是否属于对应厂商,再正向解析回去比对。真爬虫经得起这个来回,伪造的过不了。分不清真假就统计抓取频次,数字再漂亮也没意义。
四个字段就能定位大部分问题
不必上专业日志分析平台,宝塔面板里下载当天的 nginx 日志,看四个字段:爬虫标识、请求路径、状态码、时间戳。
状态码先看。整片 403、503 说明请求在防火墙或 CDN 那一层就被挡住了,运维加过一条按关键字拦截的规则,前台访问一切正常,抓取器全进了黑名单,这类故障最隐蔽。大量 404 说明 sitemap 里挂着已删除的 URL,机器每次来都在撞墙。301 连跳两级以上也要处理,跳转链一长,很多抓取器就不跟了。
再看请求路径的分布。按路径前缀聚合一次,看抓取覆盖落在哪些目录:是文章正文页多,还是列表页、参数页多。理想状态是正文页占大头,因为那才是可能被摘取的内容所在。
最后看时间戳的间隔。同一个爬虫标识每天回访、且新发的页在几天内就被请求,说明通道是通的。若最近一次记录停在两个月前,先排查服务器稳定性和 robots 规则,别急着找内容原因。
抓取预算最容易漏在这四处
标题里说"大半花在筛选页上"不是夸张。抓取预算是有限的,一个站每天被读多少页大致有个上限,浪费掉的部分就挤走了正文页的名额。常见的漏点有四处:
带筛选参数的列表页。价格区间、地区、排序方式两两组合,能生成成千上万个内容几乎相同的 URL,机器一条条读,读完发现全是重复。
无限分页。列表翻到第几十页仍然可访问,越往后内容价值越低。
站内搜索结果页。这类页面本身没有独立信息,却常被内链或外部链接带出来。
时间归档和标签页。按日、按标签自动生成的聚合页容易失控,一个不常用的标签也占一个 URL。
处理原则不是一刀切封禁,而是让有价值的正文页优先。参数页统一 canonical 指向不带参数的版本,深层分页和搜索结果页在 robots 里禁掉,标签页只保留有实际内容量的那些。改完隔一周再拉一次日志,看正文页在抓取覆盖里的占比有没有升上来,这是能直接量化的动作。
从日志反推内容问题
日志还有一个被忽略的用法:把被抓最多的十条路径和你最想被引用的十个页面并排放,看重合度。
不重合的情况通常有两种。一种是想被引的页压根不在被抓列表里,多半是它入口太深,从首页点四五次才到,站内没有链接指向它。补内链、进 sitemap 就能解决。另一种是被抓得很勤但从没在答案里出现,说明抓到了却没被选中,问题回到内容本身:段落没有独立结论、缺少可核对的事实、术语和用户提问的说法对不上。
这两种情况的处方完全相反,凭猜测判断很容易开错药,日志能帮你分清是哪一种。
三个常见误做
第一个是只统计总抓取量。总量涨了未必是好事,如果涨的部分全落在参数页,那是浪费在扩大。要看的是正文页的抓取覆盖比例。
第二个是把所有陌生 UA 一律拉黑。运维图省事写一条"含 bot 就拦"的规则,正规抓取器一起被关在门外,之后所有内容投入都收不回来。
第三个是只在改版当天看一次日志。抓取状况会随服务器负载、CDN 策略、模板改动波动,固定成每周一次的例行检查,比出问题再回头查快得多。
三行自测
打开最近七天的日志,能否列出至少三个生成式引擎抓取器的访问记录,并且来源已核验过真假?
按路径前缀聚合后,正文页在抓取覆盖里的占比是否高于列表页和参数页之和?
你最想被引用的那批页面,有几条出现在被抓路径清单里?
三个问题都答得出来,才算真正掌握了自己站点的抓取情况。答不出来的那一项,就是这周该动手的地方。