新版官网切换后,产品页从办公室电脑打开正常,百度搜索仍只显示旧地址。网站人员连续提交新 URL,几天后结果没有变化,服务器日志里甚至找不到百度抓取这张页面的记录。此时继续改标题或重复提交都缺少依据。排查应先判断页面停在发现、抓取还是索引阶段,再沿改版路径找断点。

先判断停在发现、抓取还是索引
百度没有收录一张改版后的页面,可能对应三种状态。搜索系统尚未发现 URL,服务器没有收到抓取请求;搜索系统已经请求,但页面返回错误、跳转或受限内容;搜索系统取得正常正文,却暂未把页面放入可检索索引。三种状态需要不同动作,不能都靠再次提交处理。
网站人员先在百度搜索资源平台核对 URL 提交与抓取反馈,再查服务器访问日志中该地址的请求时间、状态码和抓取标识。日志完全没有请求时,重点检查发现入口。出现请求却返回 301、403、404 或 5xx 时,先修响应。返回 200 仍没有索引,则继续核对正文、规范地址和重复页面。
site 查询只能提供搜索结果侧的线索,不能证明页面从未抓取。浏览器能打开也不足以证明搜索程序拿到了同一份内容。检查者应使用未登录请求访问正式 HTTPS 地址,查看首个 HTML 是否包含标题与正文,确认页面没有依赖登录、地区判断或脚本执行后才显示主要内容。
沿公开路径定位改版留下的断点
改版最常见的发现断点出现在栏目列表。新产品页已经写入数据库,栏目却仍按旧日期排序,首页和分类页都没有指向它;sitemap 也没有重建。搜索程序只能等待其他页面偶然出现链接。网站人员应从首页进入对应栏目,沿可抓取分页寻找目标 URL,并核对站内链接使用的是正式伪静态地址。
发现入口的通过条件,是目标 URL 至少出现在有效栏目或相关内容页中,同时在 sitemap 里仅出现一次。sitemap 的地址必须与页面 canonical 完全一致,lastmod 应反映本次有效修改日期。可参照新页面提交百度前的规范地址检查核对协议、域名和路径。
抓取断点要从响应链逐跳检查。旧页面有等价新页面时,可设置一次 301;没有替代内容时应明确返回 404,不能把所有旧地址都跳到首页。新页面本身应直接返回 200,robots.txt 不应阻止所属栏目,HTML 里也不能残留 noindex。缓存若仍输出测试域名 canonical,清缓存后必须重新取一次公网响应。
已经抓取却未入索引时,先比较新旧页面是否实际回答同一个问题。改版只换模板、标题和 URL,正文与旧页几乎相同,搜索系统可能继续选择旧地址。此时要按官网改版后的旧地址处理方法确认旧页去向,并让新页的标题、正文和资料版本共同指向当前对象。
修复后只提交规范地址并设置复查点
每次排查只改动已经证实的断点。栏目缺链接就补入口,sitemap 漏页就按有效内容重建,canonical 错误就修模板或缓存。不要在同一天同时改标题、正文、跳转和页面路径,否则下一次抓取发生后,网站人员无法判断哪个动作解决了问题。
修复完成后,网站人员从公网重新取得页面、首页、栏目、robots.txt 和 sitemap,保存状态码、canonical、目标 URL 出现次数及服务器日志时间。确认这些证据一致后,再向百度提交唯一规范地址。提交成功只代表地址进入处理队列,不能作为已经抓取或已经收录的证明。
复查时间应围绕可观察事件设置:服务器首次出现百度抓取后,核对返回内容与状态;搜索资源平台更新反馈后,记录页面所处阶段;搜索结果出现目标 URL 后,再检查标题、摘要和 canonical 是否一致。若日志持续没有请求,继续修发现路径;若多次抓取均为 200 仍未入索引,再评估页面独立价值,避免用重复提交掩盖内容问题。
