内容提要
本文介绍特征工程方法,包括缺失值填充、无效值剔除、分类编码、特征衍生与分箱、时间与统计特征、多项式及N-to-N变换、时序和文本图像特征等。对比DNN、SVR、RF、GBM的特征构造能力:DNN最强,SVR最弱但适合搭配DNN,RF与GBM相近。特征选择分为过滤法、包装法、嵌入法,并提及相关工具与案例。
延伸解读
模型构造特征能力的差异
文章对比了DNN、SVR、RF、GBM在构造多种特征时的表现。DNN学习能力最强,SVR最弱但适合与DNN搭配,RF和GBM表现非常类似。所有模型在构造r_diff特征时能力都最弱,表现最差的依次是r_diff、max、dev。这提示读者:若特征涉及复杂比值或差值,可能需要依赖DNN或组合模型,而树模型在部分特征上可能力不从心。
特征选择方法的适用场景
文章将特征选择分为过滤法、包装法和嵌入法。过滤法通过单特征区分度(如IV值)筛选;包装法通过不断加入或删除特征观察模型指标变化;嵌入法则看特征权重,并可引入正则。模型相关方法可看树模型的分裂增益。选择时需权衡计算成本与效果,过滤法快但可能忽略特征间关系,包装法准但计算量大,嵌入法折中。
特征工程对模型稳定性和解释性的影响
文章指出特征工程直接影响模型稳定性,可考虑以正则方式加入模型。同时,特征工程也关乎解释性,例如通过探索性数据分析(EDA)理解特征相关性,利用主成分分析、相似度或聚类。这意味着在实际项目中,除了追求效果,还需关注特征是否带来稳定的泛化能力,以及能否向业务方解释模型决策。
Q&A
特征工程中如何处理缺失值和无效值?
缺失值可以填充0、均值或中位数;无效值包括只有一个取值或没有区分度的特征,通常需要剔除。
分类特征有哪些常用的编码方式?
常用的编码方式有Label Encoder、OneHot Encoder和Target Encoder。
不同模型在构造特征方面的能力对比如何?
DNN构造特征能力最强,SVR最弱但适合与DNN搭配,RF和GBM表现非常类似。
特征选择有哪些主要方法?
特征选择分为过滤法(如单特征区分度、IV值)、包装法(不断加入/删除特征看模型指标变化)和嵌入法(看特征权重,可引入正则)。
特征分箱有哪些常见方式?
特征分箱常见方式有等频分箱、等距分箱和卡方分箱。
有哪些工具可以辅助特征工程?
Spark提供了特征分桶、标准化等接口;Featuretools是特征扩展包;AutoGluon是自动机器学习库。