机器学习面试题 8:数据清洗与特征处理

机器学习面试题 8:数据清洗与特征处理

💡 原文中文,约1900字,阅读约需5分钟。
📝

内容提要

本文介绍机器学习面试中数据清洗与特征处理的方法。数据清洗包括数据采样(随机采样、固定比例采样)和样本过滤(结合业务去除异常数据,利用偏差、距离、密度等异常检测算法)。特征处理涵盖归一化(函数、分维度、排序归一化)、离散化(等值、等量划分)及缺省值处理(单独表示、众数、平均值等),旨在提升模型性能。

🔎

延伸解读

采样与过滤的实践要点

数据采样时需根据问题类型选择策略:分类问题关注正负例平衡,回归问题则需覆盖数据分布。样本权重可调整不同样本的重要性。样本过滤应结合业务规则(如去除爬虫、垃圾数据)与异常检测算法,后者包括基于统计、距离和密度的方法,各有适用场景,如统计法适合单变量数值,距离法适合全局异常,密度法能发现局部异常。

归一化方法的选择依据

归一化旨在消除特征量纲影响,避免模型偏向取值范围大的特征。函数归一化(如最大最小值)是线性映射,简单但易受极端值影响;非线性映射(如log)可压缩长尾分布。分维度归一化使用局部最大最小值,适用于类别内差异显著的情况。排序归一化基于序数,对异常值鲁棒,但丢失数值间距离信息。选择时需考虑数据分布和算法敏感性。

离散化与缺省值处理的权衡

等值划分按值域均分,简单但可能使样本分布不均;等量划分按样本数均分,能避免数据稀疏问题,但可能破坏数值的线性关系。缺省值处理需谨慎:单独表示可保留缺失信息,众数或平均值填充简单但可能引入偏差。实际中应结合业务含义和数据缺失比例,选择合适方法,并评估对模型性能的影响。

Q&A

数据清洗中数据采样有哪些方法?

数据采样方法包括随机采样和固定比例采样等。

样本过滤中常用的异常点检测算法有哪些?

常用的异常点检测算法包括偏差检测(如聚类、最近邻)、基于统计的异常点检测(如极差、四分位数间距、均差、标准差)、基于距离的异常点检测(如绝对距离、欧氏距离、马氏距离)和基于密度的异常点检测(如LOF算法)。

为什么需要对特征进行归一化?

因为不同特征的取值范围可能差异很大,在如线性模型、聚类模型、KNN等算法中,取值范围大的特征会对结果产生较大影响,导致模型偏向于这些特征。归一化可以将特征取值映射到[0,1]区间,平衡各特征的影响。

特征归一化有哪些常用方法?

常用方法包括函数归一化(如最大最小值归一化、log函数等非线性映射)、分维度归一化(使用所属类别的局部最大最小值)和排序归一化(按特征大小排序赋予新值)。

连续特征离散化有哪些方法?

常用方法包括等值划分和等量划分。等值划分按值域均分,如[0,10]划分为10段;等量划分按样本总数均分,每段等量样本,避免样本分布不均的问题。

特征缺省值如何处理?

缺省值处理方法包括单独表示、众数、平均值等。

🏷️

标签

➡️

继续阅读