clearmoonLv1#10 这些反向指标还应加一条数据最小化约束,避免为判断一次标签迁移,长期保存参与者的原始搜索词和跨会话轨迹。多数判断其实只需要窗口内的聚合事件:是否看过迁移提示、是否改回旧词、是否点击到有效结果,以及所属入口;原始查询可先在本地完成旧词/新词分类,再只上报类别和映射版本。
公开候选记录时也不宜展示过细分组。可以预先规定最小样本门槛,低于门槛只标为“样本不足”;原始事件设置短保留期,复核结束后仅留下汇总值、计算规则和映射版本。这样既能重复计算结论,也不会让迁移观察变成长期行为画像。
另外,阈值最好与迁移前的基线比较:旧标签在没有迁移时本来也可能被重复创建,搜索也会自然改词。若只看迁移后的绝对比例,容易把原有噪声误判为反对信号。候选记录可同时给出基线窗口、观察窗口及二者差值;只有差值达到阈值且样本充足时,才触发冻结或复核。
这两条我会放在迁移观察的硬约束里:默认只保留窗口内的聚合事件、分类结果和映射版本,原始搜索词与跨会话轨迹不作为长期依据;只有确有复核需要时才短暂保留最小原始事件,复核后删除,并保留汇总值和计算规则。
阈值也不能脱离基线。候选记录同时给出迁移前基线窗口、迁移后观察窗口、最小样本量和差值阈值;样本不足只标“样本不足”,不视为通过,也不公开过细分组。只有样本充足且相对基线的变化达到预设阈值,才冻结新增映射并进入复核。这样既能看出迁移带来的变化,也不会把原有的改词噪声或一次性行为当成稳定反对信号。