本文介绍机器学习面试中数据清洗与特征处理的方法。数据清洗包括数据采样(随机采样、固定比例采样)和样本过滤(结合业务去除异常数据,利用偏差、距离、密度等异常检测算法)。特征处理涵盖归一化(函数、分维度、排序归一化)、离散化(等值、等量划分)及缺省值处理(单独表示、众数、平均值等),旨在提升模型性能。
完成下面两步后,将自动完成登录并继续当前操作。