区分访问抓取与索引结果,关键看日志和索引状态报告回答的是两个不同问题:抓取只说明搜索引擎的爬虫来过、下载了页面;索引则说明页面经过处理后被选入可展示的结果集。内链策略的作用,是决定爬虫能否沿链接到达目标页,以及目标页在站点结构中是否被当作重要页面。因此,判断时要先看“有没有被抓”,再看“抓了之后有没有被索引”,不能把一次成功抓取当作已经收录。
从交付结果倒推,抓取交付的是服务器访问记录,通常表现为日志中的请求时间、URL、状态码和爬虫标识。索引交付的是搜索引擎结果中的可展示状态,表现为该URL能否被搜到、是否出现在站点查询结果中。两者的验收对象不同:抓取验收看爬虫是否按预期访问目标URL,索引验收看目标URL是否进入结果集。内链策略要交付的结果是:重要页面能被爬到,且爬取预算不被低价值页面大量消耗。
内链策略主要影响抓取发现和权重传递,不能直接命令搜索引擎索引。一个页面被抓取,只代表爬虫取到了内容;是否索引还要看页面是否值得进入结果集。常见情况是:新页面通过内链被快速发现并抓取,但内容与站内其他页面高度重复,于是停留在“已抓取未索引”。此时继续增加内链数量通常无效,应改为合并重复内容或调整页面定位。反过来,如果页面从未被抓取,检查内链是否可达、是否被robots.txt拦截、是否只存在于站点地图而没有站内链接。
先选一个明确的目标URL,例如某个栏目页或文章页,记录它在站内被哪些页面链接、链接是否为可抓取的普通链接。然后到服务器日志中查这个URL是否被爬虫请求过,再到对应搜索引擎的索引状态中查它是否被编入索引。若日志无记录,先修内链路径和抓取限制;若日志有记录但未索引,先处理内容重复和页面价值。这个顺序能避免把抓取问题误判成索引问题,也能避免用内链策略去解决它解决不了的索引筛选问题。
下一步:挑一个目标URL,分别记录“最近一次抓取时间”和“当前索引状态”,再用站点内链路径解释两者是否一致。若不一致,按上面顺序判断是抓取环节还是索引环节出了问题。