要区分访问抓取与索引结果,核心是看证据来源:服务器日志、抓取统计和页面响应只能证明搜索引擎来过、抓过,不能证明页面已经进入索引。索引结果必须回到搜索结果页、站点查询指令或搜索平台提供的索引状态报告中去核对。两者混在一起看,就会把“抓取成功”误判为“已经收录”。
抓取属于访问行为,索引属于建库行为,二者不是同一环节。判断时先给证据分类:
site: 查询结果不稳定,只能作为参考;站点地图提交成功只说明文件被读取,不代表页面被索引;robots.txt 禁止抓取会影响抓取,但用它来阻止索引并不可靠,因为页面仍可能因外部链接被索引。如果日志里出现大量 200 响应,只能说明抓取顺利;如果索引报告显示“已发现,尚未编入索引”,说明抓取可能已发生,但索引尚未完成。这两种状态要分开记录。
最关键的一步是建立“同一 URL 的双向对照表”,把抓取证据和索引证据按 URL 一一对齐,而不是分别看总量。
判断规则可以这样用:日志有抓取、索引报告显示已索引,属于正常;日志有抓取、索引报告显示未索引,重点查内容质量、重复页面、规范化标签和抓取预算;日志无抓取、索引报告显示已发现未抓取,重点查内链是否可达、服务器是否响应过慢;日志无抓取、索引报告也无记录,先确认页面是否被 robots.txt 拦截或返回了错误状态码。
验证索引时不要只看一次搜索结果。可以取页面标题中的独特短语或正文中的唯一句子做精确查询,看目标 URL 是否出现;再结合搜索平台的索引状态报告交叉确认。如果两者矛盾,以索引状态报告和实际可检索结果为准,并记录查询时间,因为索引状态会随抓取和重算变化。
验证抓取时,可以临时观察日志中该爬虫对目标 URL 的请求是否带有正常状态码。注意区分“可能原因”和“已定位原因”:日志没有记录,可能是爬虫未访问,也可能是日志被轮转、过滤或采样,不能直接断定页面被拒绝抓取。
网站内链结构会随栏目调整、页面合并和模板改动而变化。建议定期抽查重要页面的内链入口数量和层级深度,并同步核对抓取与索引状态。内链过深、入口单一或大量指向已失效地址,都可能让抓取减少,但抓取减少并不自动等于索引丢失,仍需回到索引证据确认。
下一步可以选 5 到 10 个核心页面,按上面的对照表做一次抓取与索引的逐项核对,先找出“已抓取但未索引”和“未抓取也未索引”两类页面,再分别处理内链入口、页面状态和内容重复问题。