要取得可复查的状态证据,核心做法是:为每个待确认的URL建立一条带时间、查询方式、原始返回结果和截图的记录,让任何人按同样步骤都能得到相同结论。假设你负责一个约200个页面的站点,时间和人手只够先处理一批URL,那么第一步不是改代码,而是先固定“证据格式”,再决定处理顺序。
可复查不等于“我搜过了”。它至少要满足三点:查询对象明确(完整URL,而不是首页或栏目页)、查询时间明确、原始结果可保存。对google网站收录而言,可用的证据来源主要有:site:查询结果、Search Console中的网址检查结果、页面自身的HTTP状态与可抓取性记录。注意site:只是估算,不能当作精确收录数量;Search Console的网址检查反映的是Google对该URL的已知状态,也不等于排名表现。
每条记录建议包含以下字段:
site:、网址检查、日志或抓取工具)假设某站点有200个URL,其中30个是近期新增的产品页,170个是历史文章。人手只够先查50个。此时不要随机抽样,而应按“业务价值 × 不确定性”排序:新增且未被任何查询命中的URL优先,因为它们最可能暴露抓取或索引问题。历史文章中流量稳定的页面可以后查,因为即使状态不明,损失也较小。
具体执行步骤:
常见错误有三个:一是用首页的site:结果推断某个内页已收录;二是把robots.txt放行当成一定收录,实际上robots.txt只控制抓取,不控制索引,限制抓取也不等于可靠的索引移除;三是看到HTTPS就认为页面安全且必然被收录,HTTPS既不保证无漏洞,也不保证排名或收录。
面对一个“查不到”的URL,可以按下面顺序判断,不要一次修改多个变量:
同一现象可能有多个解释。例如“网址检查显示未收录”,可能是新页面尚未被抓取,也可能是内容重复被合并,还可能是服务器返回不稳定。没有进一步证据前,不要断言唯一原因。
记录完成后,按结论分组处理:未抓取的URL检查内链与站点地图;已抓取未收录的URL检查内容是否与已有页面高度重复;被排除的URL核对canonical与robots规则。每处理一项,隔一段时间用同样的查询方式复测一次,新旧记录成对保存,这样才算真正可复查。下一步可以从清单中挑出10个新URL,先跑完一轮记录,再决定是否扩大范围。