特征工程最后一道防线是"别作死"——防泄漏。三个保命细节,任何一个出问题,模型上线都翻车。
防泄漏(最致命):不小心把答案相关信息喂给模型,导致线下好看线上崩。两类最常见:① 时间泄漏,用了申请时还不存在的信息(如贷前模型用借后还款行为——客户还没借呢);② 标签同源,变量由 Y 推导(如用"是否催收过"预测"是否坏",催收就是因为坏才催,等于把答案告诉模型)。
单调性:分箱后希望 WOE 随原始变量单调(收入越高越偏"好")。不单调,业务方会问"为什么收入中等反而最危险",答不上来模型就不可信。不单调时合并相邻箱或重分箱。
切点一致:分箱切点如果只在训练集"完美",验证集分布变了就失效。要检查训练集定的切点在验证集/OOT 上是否依然合理,不一致说明过拟合,要加粗分箱或换稳健方法。
顺带复习:类别变量缺失别填众数,单列成类,"缺失"本身可能是风险信号。
到这 M2 结束,你能搭一套"可解释、可追溯、可监控、防泄漏"的特征体系了。下个模块 M3 是重头戏——用这些特征从数据里挖出可上线的策略规则。






