判断采集是否遗漏,核心不是看总抓取量够不够大,而是把站内统计、搜索引擎报告和第三方估算流量三套口径分开比对,再回到原始日志或抓取样本里找缺失证据。只要出现“页面明明存在、却查不到被抓取记录”或“站内点击与报告展示量差异长期集中在某类模板”的现象,就应优先排查采集遗漏,而不是先调内容策略。
站内统计记录的是用户实际到达页面的次数,搜索引擎报告记录的是该引擎自己认可的展示与点击,第三方估算流量则是基于抽样与模型推算。三者的统计对象、去重方式和时间窗口都不同,直接相减得到的差额不能全算作采集遗漏。
可执行的判断顺序是:
noindex、是否被 robots.txt 拦截。适用条件:站内统计本身要能区分自然搜索来源,否则第一步就无法对齐。判断结果分两种:如果缺失集中在同一模板,多半是模板级配置问题;如果缺失零散分布,更可能是链接深度或抓取预算分配问题。
要确认“是否遗漏”,最直接的证据是抓取记录。可以在服务器日志里筛选搜索引擎爬虫的 User-Agent,统计它实际访问了哪些 URL、返回了什么状态码。这一步不需要复杂工具,一段日志过滤规则就能跑出结果。
重点看三类信号:
200 的 URL 数量,与站点地图里提交的 URL 数量是否长期差距过大。301 跳转链,导致爬虫在跳转中放弃。5xx 的时段,且该时段恰好是爬虫集中访问的时间。假设某个栏目有 200 个详情页,站点地图全部提交,但日志一周内只出现 40 个不同 URL 的抓取记录,其余页面既没有报错也没有被拦截。这时可以判断为疑似采集遗漏,优先检查该栏目的内链是否只从列表第一页可达,深层页面缺少入口。这个例子只用于说明排查方法,不代表任何真实站点数据。
排查不是找到一次差异就结束,而要设定可复核的验收标准。建议同时满足以下条件再认为该轮采集遗漏问题已定位:
注意,验收信号只能说明“这批 URL 已被抓取”,不能推断排名或流量一定上升。抓取是收录的前置条件,收录之后还要看内容质量与竞争情况。
如果只能投入很少精力,优先做一件事:把站点地图里的 URL 与最近一段时间的抓取日志做一次交集比对,列出“提交了但没被抓”的清单。这一步成本最低,且能直接回答采集是否遗漏。
拿到清单后,不要立刻改内容,先按模板归类。同一模板下大量 URL 缺失,处理模板配置的收益远高于逐页修改。只有当缺失零散且无共同模板特征时,才需要逐页检查内链与状态码。
下一步可以固定一个每周一次的比对动作:导出站点地图 URL、导出抓取日志中的 URL,计算差集并记录数量变化。连续几周观察差集是扩大还是收窄,就能判断采集问题是在恶化还是已被控制。