要取得可复查的状态证据,核心是让每一次网站收录检测都留下“时间、对象、原始返回、判断依据”四要素。做法上有两条路径:一是用搜索引擎官方工具导出或截图收录状态,二是用命令行请求抓取原始响应并保存为文件。前者贴近搜索引擎实际索引库,后者可复现、可版本对比,但两者都不能单独证明“已收录”或“未收录”,需要交叉验证。
网站收录检测不是查一个“是或否”,而是回答几个不同命题:URL 是否被抓取过、是否进入索引、索引的是哪个版本、是否被规则屏蔽。命题不同,证据类型不同。
robots.txt、页面 <meta name="robots">、HTTP 状态码与 canonical 指向。如果命题没定,任何证据都会被误读。比如 robots.txt 禁止抓取,只能说明爬虫被限制,不等于页面已从索引移除;已索引的 URL 仍可能因历史抓取而保留一段时间。这是判断路径选择的第一道分叉。
适用条件:需要向他人说明当前索引状态,或需要平台给出的抓取与索引数据作为依据。代价是数据由平台提供,导出格式、保留时长、可查询范围受平台规则限制,且不同搜索引擎各自独立,必须分别核查。
可执行的取证步骤:
2025-06-01-bing-index.csv。检查项:导出文件是否包含查询时间、URL、状态字段;截图是否包含完整查询语句和结果数量;同一 URL 在不同搜索引擎的结果是否分开记录。判断结果时注意,站点地图提交不保证收录,它只表达“希望被抓取”,不能作为已收录的证据。
适用条件:需要可复现、可脚本化、可纳入版本管理的证据,或需要确认服务器实际返回内容。代价是需要能访问命令行,且要自行解释响应含义,不能直接得到“是否在索引中”的结论。
可执行的取证步骤:
curl -I 获取响应头,保存 HTTP 状态码、X-Robots-Tag、canonical 相关头信息。curl -s 获取页面正文,保存为文件,同时记录抓取时间。<meta name="robots"> 与 <link rel="canonical">,确认是否存在 noindex 或指向其他 URL。curl 请求 /robots.txt,保存内容,核对目标路径是否被 Disallow 覆盖。检查项:状态码是否为 200;是否返回 noindex;canonical 是否自指;robots.txt 是否屏蔽了目标路径。判断结果时注意,HTTPS 只说明传输加密,不保证页面安全无漏洞,也不保证被收录或获得排名。命令行证据证明的是“服务器返回了什么”,不是“搜索引擎索引了什么”,两者必须分开陈述。
决策可以按三个条件走:
组合步骤:先冻结 URL 清单与检测时间;再跑命令行取证,保存原始响应;随后在官方工具查询同一批 URL;最后把两份记录按 URL 对齐,对不一致项单独标注可能原因,例如抓取限制、索引延迟、canonical 冲突。可能原因与已定位原因要分开写,一项现象往往有多种解释,不要只归因于一个因素。
第一,记录检测时间与时区,索引状态会随时间变化,没有时间的截图无法复查。第二,保存原始返回而不是只保存结论,结论可以重写,原始响应不能。第三,为每条证据写明它证明了什么、不能证明什么,例如“robots.txt 允许抓取”不能推出“已被索引”。
下一步:挑一个当前状态不明的 URL,按上面的组合步骤做一次完整取证,把命令行原始响应和官方工具查询结果放在同一目录,标注检测时间,之后每次复查只追加新文件,不覆盖旧文件。