网站收录检查:日志中应该核对哪些字段?先分清抓取与索引两条线

📍 WDQWDWQD987AAAAA:216.73.216.143
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /147fc5a446a4.html
📄

网站收录检查:日志中应该核对哪些字段?先分清抓取与索引两条线

做网站收录检查时,服务器日志里最该先核对的是能区分“谁来过、要了什么、结果怎样”的字段:时间、客户端IP、请求方法、请求URL、状态码、响应大小、User-Agent和Referer。它们能帮你判断搜索引擎爬虫是否抓取了目标页面、抓取是否成功,以及抓取后的页面是否具备被索引的条件。日志只能证明抓取行为,不能直接证明页面已收录,所以要把日志字段与索引状态分开看。

先看哪几个字段,能回答“爬虫来过没有”

观察阶段建议按下面顺序核对:

再看哪些字段,能判断“抓取结果是否可用”

判断阶段重点看响应大小、Referer和状态码组合:

这里要区分“可能原因”和“已经定位的原因”。例如,某URL返回403,可能是服务器防火墙拦截,也可能是应用层权限设置,还可能是爬虫请求头被规则拒绝;只有结合服务器规则、应用日志和复现请求,才能确认是哪一种。

两种处理方案:先修抓取,还是先修索引

日志核对后,常见分歧是:页面没收录,到底先处理抓取问题,还是先处理索引问题。可以用下面的对比来判断。

两种方案不是互斥的。判断依据是日志字段给出的证据:没有抓取,优先修抓取;已经抓取但未索引,优先修索引条件。robots.txt的抓取限制不等于可靠的索引移除,站点地图也不保证收录,所以不能用“已提交”代替实际核查。

一个可执行的日志核对步骤

假设你要检查/article/example是否被正常抓取,可以按以下步骤执行:

  1. 在日志中筛选该URL,保留时间、IP、User-Agent、状态码、响应大小五个字段。
  2. 按时间排序,看最近一次抓取是什么时候,是否持续出现。
  3. 把User-Agent与官方验证方式核对,排除伪造爬虫。
  4. 看状态码:200继续看响应大小;301/302记录跳转目标;404检查内链;403/5xx检查服务器规则和应用错误。
  5. 如果200且响应大小正常,再到索引侧核对页面是否允许索引、规范标签是否指向自身。
  6. 修改后复查同一URL的日志记录,确认状态码、响应大小和抓取频率是否朝预期方向变化。

如果站点使用HTTPS,也不要因为协议是HTTPS就默认页面一定安全或一定被收录;证书、混合内容和索引状态要分别核查。不同搜索引擎的爬虫验证方式和支持情况需要分别核对,不能拿一个爬虫的日志结论直接套到所有搜索引擎。

复查时看什么,避免把抓取当成收录

复查阶段建议同时记录两组结果:一组是日志中的抓取字段,另一组是索引状态。日志显示200抓取,只说明服务器成功返回了页面;页面是否被索引,还要看索引状态、规范标签和页面质量。若日志中目标URL始终没有出现,先检查内链和站点地图是否指向它;若出现但状态码异常,先修服务器或应用返回;若一切正常但仍未索引,再回到页面内容与索引规则上排查。

下一步可以直接从最近7天日志中筛出目标目录的URL,按状态码分组统计,再挑出“有抓取但未索引”和“无抓取”的两类URL分别处理。

图1 图2

nginx