先给结论:额度有限时,不要按“看起来重要”挑样本,而要按“能改变你下一步动作”挑样本。优先选结果分叉最大的对象——也就是同一批链接里,外链结构、来源类型或页面层级差异明显的那几个。假设你手上有 200 个待查页面,额度只够 20 次,正确做法是先用这 20 次覆盖 4 到 5 种明显不同的类型,而不是把首页全查一遍。
常规做法是先查首页和核心栏目页,理由是它们权重最高。但这类页面的外链结构通常高度相似:都来自导航、站内推荐和少数几个固定来源。查完 5 个首页,你得到的信息可能只有一条,剩下的额度被同质结果浪费掉。
真正有信息量的样本,是那些预期结果会互相冲突的对象。比如一个老栏目页和一个新落地页,一个被大量转载的文章页和一个几乎没人引用的产品页。它们之间的差异能直接告诉你:这个站的权重是靠历史积累、内容传播,还是靠站内结构撑起来的。这比多查几个首页有用得多。
在没有实际查询结果之前,你可以用页面自身特征预判分叉程度:
假设你有 20 次额度,可以这样分配:首页 2 个、栏目页 3 个、内容页 8 个(其中老文 4 个、新文 4 个)、标签或聚合页 3 个、剩余 4 个留给结果最意外的对象。这个分配不是固定公式,但它保证了你覆盖的是不同类型,而不是同一类型的重复。
假设某站点有 200 个页面待评估,你只有 20 次查询额度。第一步不是打开工具,而是在表格里给每个页面打两个标签:层级(首页/栏目/内容/聚合)和来源预期(单一/混合)。
打完标签后,你发现 200 个页面里有 140 个是内容页,且来源预期都标为“混合”。这时候如果直接按顺序查前 20 个内容页,你很可能得到 20 条高度相似的结果。正确的动作是:从这 140 个里挑出外链数预估最高和最低的各 5 个,再从中随机抽 5 个,凑成 15 个内容页样本;剩下 5 次额度分给首页、栏目页和聚合页各 1 到 2 个。
这个动作的结果是:你可能会发现高外链页和低外链页的引用来源类型完全不同,或者发现某个栏目页的外链反而比首页更集中。无论哪种,都会直接影响你下一步是继续查内容页,还是转去查站内结构。如果 15 个内容页的结果几乎一致,那说明这个站的外链模式很统一,剩余额度就不该再花在内容页上。
拿到样本结果后,不要急着算平均值。先看两件事:
需要提醒的是,查询结果归零或某个指标异常,不能单独证明你的样本选对了或选错了。它也可能是查询条件写错、数据尚未更新、或者该页面本身就不在覆盖范围内。所以每次扩样前,先用一两个已知结果的页面做对照,确认口径没变,再继续。
如果第一轮样本显示某类页面的结果分叉最大,下一轮额度应该优先补这类页面,而不是平均分配给所有类型。比如内容页里老文和新文差异明显,那就再各取 5 个老文和新文,确认这个差异是稳定的还是偶然的。
反过来,如果某类页面的结果高度一致,即使它看起来很重要,也应该暂时搁置。把额度留给还没被验证过的类型,才是有限额度下信息量最大的用法。具体到你的站点,哪些类型值得优先补,取决于第一轮实际出现的分叉方向,而不是事先定好的清单。