上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的地址唯一且正确。最直接的方法是先用robots.txt测试工具和页面源代码检查是否误屏蔽,再用URL检查工具看实际抓取结果,最后对比站点地图、内链和规范地址是否一致。任何一项不通过,都不要急着上线或提交。
抓取是索引的前提。如果服务器拒绝、返回错误状态码,或者robots规则挡住了爬虫,页面根本进不了后续流程。核对时按下面顺序观察:
robots.txt,检查是否出现Disallow: /或误屏蔽了栏目目录。注意规则是前缀匹配,Disallow: /news会连带挡住/news-2024这类地址。判断结果:状态码200、robots允许、内容与用户看到的一致,才算抓取环节通过。若robots里确实写了屏蔽,先判断是有意为之还是上线前忘记删除——测试站常见整站屏蔽,正式上线必须移除。
抓取通过不等于会被索引。页面头部的meta指令、HTTP响应头、规范链接之间可能互相矛盾。逐项核对:
<meta name="robots">,确认没有noindex。若同时写了noindex和index,以更严格的一方为准。X-Robots-Tag: noindex。这一项在源代码里看不到,需要用抓取工具或命令行查看响应头,容易漏检。判断结果:meta与响应头都允许索引、canonical自指或指向正确主版本,索引环节才算通过。常见问题是测试阶段加了noindex,上线时只删了meta却忘了响应头,导致页面长期不被收录。
把核对做成清单,每次上线照做,比凭记忆可靠。以下步骤可直接执行:
这套清单适用于新建站、改版站和迁移站。若是迁移,还要额外核对旧地址是否301到对应新地址,避免整站跳首页这种批量错误。
提交不等于收录,复查要看实际抓取和索引状态,而不是只看提交成功提示。上线后按时间点复查:
如果复查发现页面仍被屏蔽,先区分是robots、meta还是响应头造成,再针对性修改。三项都排除后仍不收录,才考虑内容与链接层面的原因。
下一步:把上面的清单整理成本地文档,在下次上线前逐项打勾,并记录每个URL的检查结果,方便出问题时回溯是哪一步漏检。