要区分访问抓取与索引结果,核心是看两个不同层面的记录:抓取是百度蜘蛛是否来过、是否取走了页面内容;索引是百度是否把页面纳入可检索的候选库。抓取成功不等于收录,抓取失败也不等于一定不收录,必须分别查日志、抓取诊断和搜索结果,再交叉判断。
要查什么:百度蜘蛛对目标 URL 的访问记录,包括状态码、时间、User-Agent 和请求路径。
怎么查:在服务器访问日志中筛选包含 Baiduspider 的记录,重点看目标页面返回的是 200、301、302、403 还是 404。如果使用 CDN 或反向代理,要确认日志不是只记录了 CDN 回源请求。
结果说明什么:出现 200 说明蜘蛛至少成功取到了页面内容,属于“已抓取”的强信号;持续 403、503 或超时说明抓取受阻,先解决访问问题,不要急着判断收录。只有日志里完全没有 Baiduspider,才需要继续查 robots.txt、链接入口和站点地图提交情况。
要查什么:robots.txt 是否禁止了目标路径,页面是否返回正常状态码,是否有登录墙、验证码或强制跳转。
怎么查:直接访问 https://你的域名/robots.txt,逐条核对 Disallow 规则是否覆盖目标目录;再用无痕窗口或未登录环境打开目标 URL,看是否直接返回内容。
结果说明什么:robots.txt 禁止抓取会阻止蜘蛛取内容,但它不是可靠的索引移除手段:已收录页面仍可能因外部链接或历史记录出现在结果中。页面被登录墙挡住时,蜘蛛看到的是登录页而不是正文,这种情况下即使日志有记录,也不能算目标内容被抓取。
要查什么:百度搜索资源平台里的抓取诊断结果,以及百度网页搜索中 site:目标URL 的返回情况。
怎么查:在搜索资源平台对目标 URL 发起抓取诊断,看返回状态码和抓取时间;再在百度网页搜索中查 site:完整URL,观察该 URL 是否作为独立结果出现。
结果说明什么:抓取诊断成功只证明百度蜘蛛当前能取到页面,不证明已进入索引。site 查询出现该 URL,说明它至少进入了候选结果;site 查询没有出现,可能是未索引、被过滤、被替代,也可能只是查询方式不精确。多人协作时,建议把“抓取诊断结果”和“site 查询截图”分开存档,避免把抓取成功误报成收录成功。
要查什么:目标页面是否能在百度网页搜索中以标题、正文片段或完整 URL 被找到,以及收录的是不是目标版本。
怎么查:用页面标题加一段独特正文做精确搜索,再用完整 URL 做 site 查询;如果站点有 PC 和移动版本,分别核对两个版本。对参数页、分页和筛选页,要单独记录,不要用首页的收录情况代替。
结果说明什么:能搜到目标 URL 或目标正文,说明已进入索引;只搜到其他页面或旧版本,说明索引对象可能不是当前页面。HTTPS 只代表传输加密,不保证页面安全无漏洞,也不保证被收录或获得排名。
下一步:选一个目标 URL,按上面清单逐项填写“抓取状态”和“索引状态”两列;如果抓取正常但 site 查询无结果,优先核对页面内容质量、重复度和内部链接入口,而不是反复提交同一 URL。