核对抓取限制,核心是确认搜索引擎能否正常访问手机版页面,而不是先改内容或堆关键词。最常见的误解是:看到“抓取异常”就立刻调整 robots.txt,结果把原本正常的规则改坏。正确顺序是先判断限制来自哪里,再决定是否修改。
手机网站的抓取限制可能来自三个层面,处理方式完全不同:
robots.txt 禁止抓取、noindex 标签、canonical 指向错误。如果只看到“抓取失败”就改 robots.txt,可能忽略服务器对移动爬虫的限流。判断方法是分别用桌面和移动 User-Agent 请求同一 URL,比较返回码和响应内容。若移动端返回 403 而桌面端正常,问题在服务器配置,不在 robots.txt。
手机网站常用独立域名或子目录,例如 m.example.com 或 /mobile/。核对时不要只看主站 robots.txt,要确认移动版路径是否被单独禁止。执行步骤:
/robots.txt。User-agent: * 和 User-agent: Googlebot 等段落。Disallow 是否包含移动版目录、参数或整站。Disallow: /,先确认这是否为有意设置;若是误操作,移除后需等待搜索引擎重新抓取。适用条件:仅当移动版有独立 robots.txt 时才需要单独核对。若移动版与桌面版共用同一份 robots.txt,则重点看规则是否误伤了移动端 URL 参数。
搜索引擎通常提供抓取测试或网址检查工具,可以模拟移动爬虫请求。操作时输入具体移动版 URL,查看返回的 HTML、HTTP 状态码和资源加载情况。检查项包括:
<head> 中是否有 noindex。判断结果:如果工具显示“已禁止抓取”,但 robots.txt 中并无对应规则,可能是服务器防火墙或 CDN 对移动爬虫做了拦截。此时应检查服务器日志中移动爬虫的请求记录,确认是否被拒绝。
解除抓取限制后,不要用“今天改完明天收录”来判断效果。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异。更稳妥的做法是:记录修改前后的抓取请求数、返回码分布和索引页面数,观察一段时间的趋势,而不是单日数据。若抓取请求数上升但索引未变,可能是内容质量或重复页面问题,而非抓取限制未解除。
下一步:先选一个移动版重点 URL,用抓取测试工具跑一遍,记录返回码和 robots.txt 规则,再决定是否修改。不要同时改 robots.txt、canonical 和服务器配置,否则无法判断哪一项起了作用。