模型报告里,一列数据被打乱后,评价得分几乎没有下降。这个结果很容易被压缩为“该特征不重要”,甚至继续写成“这个字段没有价值”。scikit-learn 1.5.2的置换特征重要性指南提醒读者,结论首先属于被检查的模型,不能跳过对象与条件。
指南说明,这种方法在给定表格数据上,随机打乱单个特征的取值,再观察已拟合模型的得分怎样变化。它测量的是模型对该信息的依赖程度。模型、数据和评分指标共同构成评价背景,单独摘出一个重要性数字,会丢掉这个数字来自哪一次比较。
在强相关特征一节,原文描述了一种容易误读的情形:两个特征相关,打乱其中一个后,模型仍可通过另一个相关特征取得相应信息。结果可能使二者各自报告的重要性都偏低,尽管它们实际可能很重要。因此,“打乱这一列影响不大”与“模型完全不需要这类信息”不是同一个结论。
可以用一个明确虚构的资料例子理解:实验表里,甲列和乙列包含高度重叠的信息。只扰动甲列时,乙列仍保持原样。此时观察到的是仍有乙列可用的模型表现,不能把它改写成甲乙所代表的信息全部移除后也毫无影响。本文的例子仅解释比较范围,没有运行模型或编造得分。
指南开头的警告还要求先评价模型的预测能力。一个表现较差的模型中看起来不重要的特征,在较好的模型中可能重要;置换重要性不反映一个特征独自固有的预测价值。这里有两道不同的问题:模型本身表现怎样,以及这个模型依赖哪些特征。后者的表格不能替前者完成验证。
评价数据也需要保留身份。原文说明,训练集和留出的测试或验证集均可计算置换重要性;在留出数据上计算,可以观察特征对所检查模型泛化表现的贡献。评分函数不同,重要性排序也可能不同。报告若比较两次结果,应先核对模型、数据与评分口径,而不是只比较字段名旁边的名次。
对AI开发平台的资料整理,可以把“本次模型中的置换结果”“特征之间的相关关系”和“字段的业务含义”分开陈述。是否删除字段或改变模型,应另有对应实验与任务证据;一个低重要性值既不能证明业务事实没有作用,也不能建立因果结论。
本篇采用固定1.5.2指南的文字机制与警告,没有从其中图表读取实验数值。读懂一次置换,关键在于看清被改变的是什么、仍然保留的是什么,以及结果所针对的具体模型。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。