上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的地址唯一且正确。建议在正式解析域名之前完成,用“robots 规则 + 页面 meta 指令 + 站点地图 + 规范地址”四项交叉检查,任何一项冲突都可能让页面进不了索引。
抓取是搜索引擎发现并下载页面的过程,索引是它判断页面值得收录并存入结果库的过程。允许抓取不等于允许索引,禁止抓取也不等于页面一定不出现。核对时要把两者分开看:
robots.txt 是否屏蔽了整站或关键目录,服务器是否对搜索引擎返回正常状态码。<meta name="robots"> 是否写了 noindex,响应头是否带了 X-Robots-Tag: noindex。常见误区是只在 robots.txt 里放开,却忘了模板里还留着测试期的 noindex;或者反过来,页面允许索引,但 robots.txt 把 CSS、JS 目录全屏蔽,导致渲染不完整。
通化网站制作项目上线时,通常有两种做法,适用条件不同。
方案一:上线即全量放行。适合内容已定稿、栏目结构稳定、没有大量测试页的站点。代价是一旦有残留测试页或重复地址,会被较快抓取,后续要靠规范地址和 301 慢慢清理。判断标准:栏目数量明确、无用户生成内容、无多套域名同时可访问。
方案二:先屏蔽抓取,核对后再放行。适合改版站、带测试数据、有多个域名指向同一空间的站点。代价是放行后需要等待重新抓取,收录节奏偏慢。判断标准:存在 noindex 残留风险、存在 www 与非 www 同时可访问、存在带参数的大量列表页。
选择步骤可以这样走:
robots.txt。直接访问 /robots.txt,确认没有 Disallow: / 这类整站屏蔽。若写了 Sitemap 行,地址要与实际一致。判断结果:出现整站屏蔽且非有意为之,视为未通过。
页面 meta 指令。查看页面源代码,确认没有 noindex、nofollow 误用。判断结果:首页或栏目模板带 noindex,视为未通过。
规范地址。每个页面应有唯一 <link rel="canonical">,指向自身的主地址版本。判断结果:canonical 指向错误页面或缺失,可能造成重复收录。
状态码。用抓取工具或命令行请求页面,确认返回 200;已下线页面返回 404 或 301,不要用 200 假装存在。判断结果:大量软 404 视为未通过。
站点地图。只收录可索引的规范地址,不包含被屏蔽或 noindex 的页面。判断结果:站点地图含 noindex 地址,视为配置矛盾。
假设某通化企业站上线前,首页正常、产品列表页模板里残留 <meta name="robots" content="noindex">,同时 robots.txt 已放开全站。此时抓取能进来,但列表页不会进索引。处理方式是先修正模板 meta,再重新生成页面,然后请求抓取列表页。判断结果:修正后列表页可被抓取且允许索引,才算通过。这个例子说明,抓取放行与索引放行必须同时成立。
放行之后,用站点地图提交和单页抓取请求推动发现,再通过站点查询指令观察已收录地址是否为主地址版本。若发现收录的是带参数或非主域名地址,回到 canonical 和 301 配置继续收紧,而不是反复提交同一批地址。