先给结论:源站正常不等于抓取链路正常,边缘节点异常时最该保留的不是“源站返回200”的截图,而是能证明异常发生在哪一跳、持续多久、影响哪些URL的证据。两种常见做法中,只在源站复测适合排除源站问题,从边缘侧抓取并留存完整响应才适合判断收录受阻的真实位置。选择依据是异常是否可复现、是否与特定地区或节点相关。
源站正常而边缘异常,通常表现为源站直接请求返回正常状态码,但经过CDN、负载均衡或反向代理后,同一URL返回5xx、连接重置、超时或内容被截断。此时如果只在源站复测,会得到“一切正常”的结论,从而误判为搜索引擎不抓取。另一种情况是源站与边缘都不稳定,只是源站复现概率低,这时单次复测同样不可靠。
判断依据是:异常是否与请求入口相关。若从不同网络位置、不同边缘节点请求同一URL,结果不一致,就应优先怀疑边缘层。若所有入口都返回相同异常,则应回到源站和应用层排查。
当异常刚刚出现、需要判断是否由源站发布或配置引起时,先在源站直接请求目标URL是合理的。动作是绕过边缘层,用相同的URL和请求头请求源站,记录状态码、响应时间和响应体前若干字节。如果源站返回正常,而外部请求异常,就可以把排查范围缩小到边缘层。
这种做法的代价是证据链不完整。它只能说明源站当时可用,不能说明边缘节点是否稳定、异常持续了多久、是否只影响部分节点。因此它适合作为第一步,不适合作为最终结论。若此时就清理缓存或调整抓取配置,可能掩盖真实问题。
当异常可复现,或怀疑与特定地区、特定节点相关时,应从边缘侧发起请求并保留完整证据。动作包括:记录请求时间、请求URL、请求头中的User-Agent和Accept-Encoding、边缘节点返回的状态码、响应头中的缓存状态和Age、响应体是否完整、连接是否被重置。若条件允许,从多个网络位置对同一URL重复请求,比较返回差异。
这些记录的作用是区分“边缘节点返回错误”与“边缘节点返回正常但内容被改写”。如果边缘返回5xx,下一步应检查边缘节点的回源配置和健康检查;如果边缘返回200但内容缺失,下一步应检查压缩、缓存和内容改写规则。留存证据的代价是需要额外请求和存储,但能避免在源站反复复测却找不到原因。
这些证据不能单独证明“搜索引擎一定不收录”,但能证明抓取链路在边缘层存在异常。抓取量或请求量下降只是现象,可能由抓取预算调整、内容更新频率变化或搜索引擎自身调度引起,不能单独作为边缘异常的证据。
假设某站点源站直接请求返回200,但从外部请求同一URL时,约每十次出现一次502,且换一个网络位置后不再出现。此时只在源站复测会得到全部正常的结论,无法解释外部异常。正确做法是保留边缘侧请求的完整记录:时间戳、状态码、响应头、请求入口标识,并同时保留源站对照记录。若记录显示502只出现在特定节点,下一步应检查该节点的回源配置和健康检查;若记录显示所有节点都间歇出现,则应检查源站与边缘之间的连接稳定性。这个例子中的数字仅用于说明比较方法,不代表真实统计。
如果异常同时伴随源站应用错误、数据库连接失败或发布流程中断,边缘证据只能说明表现,不能替代应用层排查。另外,robots.txt的抓取限制不等于可靠的索引移除,站点地图不保证收录,HTTPS也不保证安全无漏洞或排名。边缘节点异常的证据用于定位抓取链路问题,不用于推断收录结果。不同搜索引擎对边缘异常的容忍度和重试策略不同,必要时应分别核查。
最终选择取决于异常是否可复现以及是否与特定入口相关:可复现且与入口相关时,优先保留边缘侧完整响应;不可复现且源站正常时,先保留源站对照记录并持续观察,再决定是否扩大证据采集范围。