先给结论:当一批页面只有一部分被发现,对照组不能按“已发现/未发现”直接切,而要先找一组在抓取路径上真正可比的页面,把差异缩小到一个可操作变量。下面用一个假设情境把决策过程走完。
假设某站点有 400 个详情页,全部由同一模板生成,都放在同一个目录层级,内容量级接近。站点地图提交后,后台只显示约 200 个页面被抓取,另外 200 个没有记录。此时如果直接把“被抓取的 200 个”和“没被抓取的 200 个”当成两组做对比,结论几乎一定不可信:这两组的差别可能来自上线时间、内链数量、参数、内容相似度等任何一项,而不是你怀疑的那个原因。
更稳的做法是:先锁定一个你打算验证的变量,再在“未发现”的页面里构造一个只改这一个变量的子组。对照组的作用不是证明谁对谁错,而是让下一步动作有明确指向。
“被发现”本身是模糊的。缺少完整日志或后台权限时,仍可以观察几个低成本信号:
这些信号不等于已经被索引,也不能单独证明抓取成功。但它们能把“完全没有任何入口”和“有入口但没被读取”区分开,而这两类的处理动作完全不同。
接着上面的假设:把 200 个未发现页面按“是否至少有一个站内可点击入口”分成两组,每组各取 40 个,其余条件尽量保持一致——同一模板、相近字数、同一批次上线、同一目录。这样就得到一个可操作的对照结构:
此时你验证的变量是“站内可点击入口”,而不是“是否被抓取”。如果后续 A 组开始出现读取记录而 B 组没有,你得到的结论是入口可能起作用,而不是入口一定导致收录。这个区别很重要,因为读取记录、抓取和索引是三件事。
一个实际动作:给 B 组中的 20 个页面各添加一个来自同栏目列表页的普通链接,保留另外 20 个不动,观察一段时间后看读取记录是否出现分化。这个动作的结果只影响下一步该扩大内链还是转去检查模板和内容重复,不能直接推出“加链接就能收录”。
以下情况会让分组失去可比性,需要在划分前先剔除或单独成组:
注意,robots.txt 的限制只影响抓取行为,不等于可靠的索引移除手段;被限制的页面仍可能以其他方式出现在结果里。因此被 robots.txt 挡住的页面不应混进“未发现”组,否则你比较的其实是抓取权限,而不是入口或内容差异。
没有完整日志、没有后台读取记录时,仍可执行的最小动作是:
能推出的结论仅限于:在本次观察条件下,改动组与未改动组是否出现可观察的差异。不能推出的包括:页面一定被索引、排名会变化、某个搜索引擎的抓取规律、以及“读取记录为零说明页面有问题”——读取记录为零也可能来自统计口径、采样、延迟或权限范围,而不是页面本身被拒绝。站点地图提交同样不保证收录,它只是提供发现线索。
如果改动组出现读取记录而对照组没有,下一步是扩大入口覆盖,并检查列表页是否被正常抓取;如果两组都没有变化,优先怀疑模板渲染、内容重复或抓取预算,而不是继续加链接;如果两组都出现读取记录,说明入口不是当前瓶颈,应把注意力转回页面本身的可索引条件。对照组的价值就在这里:它不给你一个结论,而是把下一个动作限定在更小的范围内。