上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能顺利抓到案例页、抓到的页面允许被索引、索引后看到的内容是案例本身而不是筛选页或空白页。时间和人手有限时,先处理会直接导致“案例页抓不到”或“抓到了也不收录”的配置,再补细节。
打开站点根目录的 robots.txt,逐条检查 Disallow 规则是否覆盖了案例列表页、案例详情页或它们依赖的图片、样式目录。常见问题是测试阶段写了 Disallow: / 或 Disallow: /cases/,上线后忘记删除。
注意区分“可能原因”和“已经定位的原因”。抓取量低可能是 robots 拦截,也可能是内链太少或服务器响应慢,不要只看一个现象就下结论。
查看案例页 HTML 的 <head> 区域,确认没有 <meta name="robots" content="noindex">。模板页、测试环境复制过来的页面最容易残留这类标签。
同时检查 HTTP 响应头里是否出现 X-Robots-Tag: noindex。它可能由服务器或中间层统一添加,页面源码里看不到,需要在响应头中核对。只要页面级或响应头级出现 noindex,即使 robots.txt 允许抓取,页面也不会进入索引。
案例展示常出现同一案例挂在多个分类下、带筛选参数、带分页参数等情况。每个案例详情页应通过 <link rel="canonical"> 指向自己的唯一地址,而不是指向列表页或带参数的版本。
如果案例详情页本身内容单薄,只有图片和一句描述,索引价值有限。这时优先补充案例背景、做法和结果说明,而不是反复调整技术标签。
时间有限时,按下面顺序执行一遍即可覆盖最关键的问题:
假设示例:某案例页在抓取测试中返回 200,但抓取结果里正文为空,只有导航和页脚。这可能是内容由 JavaScript 异步加载,而抓取时未执行脚本。此时可以查看渲染后的 HTML,或为关键内容提供服务端输出。这只是可能原因之一,需要结合抓取结果判断,不能直接断定是脚本问题。
上线并提交 sitemap 后,用站点查询指令查看案例页是否被索引。若长时间未收录,先回到抓取环节复查:服务器是否稳定返回 200、robots 是否放行、canonical 是否指向自身、页面是否有足够独立内容。
不要因为一两天没收录就频繁改动配置。抓取和索引需要时间,且不同搜索引擎处理节奏不同。可以记录每次修改的时间和内容,便于对比复查。
下一步:选一个案例详情页,按上面的清单逐项核对,把发现的问题分成“阻止抓取”“阻止索引”“影响内容识别”三类,优先处理前两类。