结论是有条件的:如果旧评分当初衡量的是“某个广告位或某次投放带来的可归因点击”,那么今天继续用它做考核,观察对象应从“分数高低”改为“同一投放意图下,被考核人能否说清成本、线索质量和后续动作的对应关系”。一旦团队把评分当成跨渠道、跨时期的通用排名依据,这个结论就失效,因为搜搜广告投放所依附的入口和统计口径本身属于需要核实的历史对象,分数不再指向同一个东西。
沿用旧评分之前,先把它拆成三层:被投放的位置、被记录的行为、被归因的结果。很多旧评分实际上只覆盖第一层和第二层,例如某个入口的曝光或点击计数,并没有能力区分点击来自搜索意图、平台推荐还是广告位误触。若考核对象是投放执行者,真正要观察的不是他能否维持某个分数,而是他能否在给定预算和素材条件下,把“投放意图—实际到达—下一步处理”串起来。
可以做一个假设例子:某团队过去用单一分值给每个投放方案排序,分值高者优先加预算。现在发现个别样本仍然有效,但规模化后例外频出。此时把观察对象改为“方案在何种条件下复现”,考核问题就从“分值多少”变成“复现条件是否写清、例外是否被记录”。
个别样本成立通常有三个原因:样本量小、投放时段特殊、或该样本恰好匹配了当时的入口规则。规模化后出现例外,往往不是执行变差,而是旧评分把不同性质的流量混在一起。此时继续用原分值做排名,会把“曾经有效的特例”误当成“普遍规律”。
一个可区分的证据是:当预算扩大后,单位成本的变化是否伴随线索质量同步变化。如果成本上升但线索质量不变,问题可能在流量结构;如果成本不变而线索质量下降,问题可能在承接环节。两种情况的下一步动作完全不同,不能用同一个分数解释。
重新定义时,建议把考核表里的“分值”替换为三列可核查信息:投放意图描述、实际观察到的行为、以及该行为触发的下一步动作。这样做的实际动作是:要求执行者在提交方案时写明假设,并在投放后记录假设是否成立。
这个动作的结果会直接影响下一步:当假设被证伪时,团队不再争论分数高低,而是回到“哪一层统计口径变了”。这也让历史概念与现行投放的边界变得清楚——旧评分可以作为历史参照,但不能作为现行排名的唯一依据。
如果团队把旧评分同时用于考核投放人员、素材质量和渠道选择,并且不允许记录例外,那么上述重新定义就会失效。因为此时评分已经变成一种管理符号,而不是观察工具。反例的特征是:任何人提出“这个样本不成立”时,得到的回应是“分数就是这样”,而不是“我们看看统计口径哪里不同”。
遇到这种反例,下一步不是继续改评分公式,而是先把考核范围缩回到单一投放意图,确认该意图下的观察对象是否一致。只有范围一致,旧评分才可能作为参考;范围不一致,任何分数比较都缺乏共同基础。
建议先选一个仍在沿用的旧评分,要求执行者用一周时间只记录“意图—行为—下一步”三列,不改变预算和素材。一周后对比:如果三列能对应上,说明旧评分还有参考价值;如果对不上,说明需要重新定义观察对象。涉及搜搜广告投放这类历史概念时,不要假定某个查询入口、历史分值或快照仍然有效,应把它当作待核实对象处理,而不是当作现行考核依据。
最终要记住:旧评分可以保留为历史记录,但考核必须回到当前可核查的行为和条件;当条件变化时,观察对象也要随之改变。