高维正则化回归中的自举和子抽样分析
内容提要
该文汇总多项子抽样与岭回归研究,提出基于协方差矩阵和预测误差的向量子集选择法,使岭估计平均预测误差有统计保证;将联合子抽样扩展为卷积抽样以加速迭代,在标签昂贵时优于独立同分布抽样;并涉及广义线性模型鲁棒初始估计、逻辑回归快速子抽样、套索与子采样风险等价、岭回归集成预测风险及高维置信区间。
延伸解读
向量子集选择:无需标签的统计保证
文章提出一种基于协方差矩阵和预测误差的向量子集选择方法,使岭估计在整个数据集上的平均预测误差具有统计保证,且无需昂贵的标签表。这意味着在标签获取成本高的场景下,可以利用未标记数据的信息来指导子集选择,为高维回归提供了一种经济有效的策略。
卷积抽样:标签昂贵时的效率优势
文章将联合子抽样扩展为卷积抽样,以加速迭代过程,并证明其效率与基于杠杆分数的独立同分布子抽样基本相同。理论和实验表明,当标签昂贵时,卷积抽样比任何独立同分布抽样具有明显优势,这为标签成本高的应用提供了更高效的抽样方案。
子抽样与岭回归的等价性及风险分析
文章从套索惩罚和子采样角度建立结构与风险的等效关系,证明子采样的二阶统计量与岭回归期望风险等价,并解决了岭回归系数比例单调预测风险的问题。此外,基于子采样的岭回归集成分析表明,岭无偏估计器的预测风险与完整无岭集合匹配,且广义交叉验证具有强一致性。
逻辑回归子抽样方法的比较与局限
文章对来自coreset和optimal subsampling文献的多个逻辑回归方法进行了直接比较,发现它们有效性不一致,很多情况下并未超过简单的均匀抽样。这提示研究者和实践者在选择子抽样方法时需谨慎,均匀抽样可能是一个稳健的基线。
Q&A
如何选择向量子集来保证岭估计的平均预测误差?
通过协方差矩阵和预测误差,提出一种选择向量子集的新方法,使得使用该子集的岭估计在整个数据集上的平均预测误差具有强大的统计保证,而无需昂贵的标签表。
卷积抽样是什么?它有什么优势?
卷积抽样是对联合子抽样过程的扩展,能加速迭代过程,实现与主要独立同分布子抽样过程之一的杠杆分数基本相同的效率。当标签昂贵时,卷积抽样比任何独立同分布抽样具有明显优势。
套索惩罚和子采样之间有什么等效关系?
从套索惩罚和子采样的角度建立结构和风险的等效关系,通过限制不同的岭正则化系数和子采样比例的路径,证明子采样的二阶统计量和岭回归分析的期望风险是等价的,提供一种基于数据推导的确定等价路径的方法。
高维向量均值的置信区间如何构建?
研究了应用于具有未知依赖关系结构的随机向量均值的广义自助法置信区间,并针对高维向量进行非渐近控制,分别采用了基于浓度原理和基于重新采样分位数量化的方法,并且考虑了蒙特卡罗法的精度问题。
岭回归集成的预测风险与广义交叉验证有什么关系?
在比例渐近情况下,基于子采样的岭回归集成,通过分析岭回归集合的平方预测风险,证明了岭无偏估计器的预测风险与含所有可能子样本的完整无岭集合的预测风险相匹配,并证明了广义交叉验证对于估计岭回归集成的预测风险具有强一致性。
逻辑回归的快速子抽样算法有哪些?
提出了一种针对逻辑回归模型的快速子抽样算法,利用优化方法降低计算时间,通过理论和实验分析验证其性能。此外,还对来自coreset和optimal subsampling文献的多个logistic regression方法进行了直接比较,发现很多情况下这些方法都没有超过简单的均匀抽样。