在额度有限的前提下,挑选样本的目标不是覆盖最多对象,而是让每一次查询尽可能多地减少你的不确定性。对旧内容、旧系统或旧合作关系做退出评估时,最值得优先查的不是“看起来最差”的那一个,而是最可能改变整体处置决策的那一个。具体做法是:先写下你打算据此做什么决定,再选一个能直接推翻或确认该决定的样本。
退出评估中常见一个反直觉现象:批量查询结果里表现最差的对象,通常不会改变你的决定,因为你本来就要放弃它。真正影响决策的,是那些处在临界位置、结果不确定的对象。
把额度花在“确认已知结论”上,信息量接近于零;花在“决定保留还是退出”的临界对象上,一次查询就可能改变整批处置方案。所以样本挑选的第一原则是:优先服务尚未确定的决定,而不是优先照顾已经确定的结论。
当你看到一批旧对象表现普遍偏低时,至少有两种合理解释,它们指向完全不同的动作:
两种解释如果混淆,会导致错误处置:把仍有价值的对象当成退化对象清掉,或者把真正失效的对象因为“以前很好”而继续保留。
要区分上述解释,样本需要具备“对照”能力,而不是只提供一个孤立数值。可用的证据类型包括:
反过来,一个样本如果无论结果高低都不改变你的动作,它就属于低信息量样本,应往后排。
假设你要处理一百个旧合作对象,额度只够查五个,目标是决定“整批退出”还是“保留一部分”。
低信息量选法是查表现最差的五个,结果必然都是“该退出”,你只是确认了已知结论,整批策略没有变化。
高信息量选法是:先按可观察特征分成三组,从每组各取一个处于临界位置的对象,再额外选两个特征相近但历史表现相反的对象作为对照。假设查询后,临界样本中有两个落在保留侧、一个落在退出侧,且对照组差异明显,那么下一步动作就是按可区分的特征缩小范围,只对临界组追加查询,而不是整批退出。这个动作的结果会直接改变后续额度分配:临界组值得继续投入,边缘组可以直接按默认规则处理。
落到操作上,可以按下面的顺序使用有限额度:
需要核对的是:不同查询工具对“权重”的定义、数据来源和更新节奏并不统一,同一对象在不同口径下可能给出不同结果。因此在用样本结果下结论前,应先确认你所用口径是否与决策目的匹配,具体工具的功能与数据范围需要以其实际说明为准。若样本结果与你的预期严重不符,优先怀疑口径差异,而不是直接判定对象退化。
最终判断标准很简单:一次查询之后,如果你对“保留还是退出”的把握没有变化,这次额度就没有换来信息;如果它让你明确缩小了需要继续处理的范围,这次查询就值得。按这个标准挑选样本,额度越少,越应该把查询留给那些真正悬而未决的对象。