CARTE:表格学习的预训练与迁移

💡 原文中文,约1500字,阅读约需4分钟。
📝

内容提要

表格预训练研究综述:TabBIE通过损坏单元格检测学习表格数据,提供单元格、行、列嵌入;SAINT用注意力机制结合行列信息,在有限标签下媲美XGBoost等;TUTA以二维坐标树结构统一预训练,提升表格与单元格分类;CT-BERT引入对比学习实现跨表预训练;TransTab将样本转为嵌入向量,支持多表部分重叠列学习。

🔎

延伸解读

表格预训练的核心挑战与应对

文章指出,表格预训练的关键挑战在于如何有效建模表格的结构信息。不同模型采用了不同策略:TabBIE通过损坏单元格检测学习表格数据,提供单元格、行、列嵌入;SAINT利用注意力机制同时考虑行列信息;TUTA采用二维坐标树结构统一预训练。这些方法都试图在有限标签下提升性能,但各自侧重不同,读者需根据任务特点选择。

跨表迁移与部分重叠列的处理

TransTab和CT-BERT关注跨表预训练。TransTab将样本转为嵌入向量,支持多表部分重叠列学习;CT-BERT引入对比学习实现跨表预训练。XTab则通过自监督学习和联邦学习解决跨表不一致问题。这些工作表明,处理多表部分重叠列是实际应用中的重要方向,但各方法在泛化性和效率上仍有差异。

与传统机器学习方法的性能对比

SAINT在有限标签下取得了与XGBoost、CatBoost和LightGBM相当的准确率,显示了深度学习在表格数据上的潜力。然而,传统方法在计算效率和可解释性上仍有优势。NCART尝试将决策树集成到神经网络中,以平衡性能与解释性。读者在选型时需权衡准确率、计算成本和可解释性。

❓

Q&A

表格预训练中,TabBIE 模型的核心预训练目标是什么?

TabBIE 采用损坏单元格检测作为预训练目标,仅从表格数据中学习,并在表格预测任务上达到最先进水平。

SAINT 模型如何利用注意力机制处理表格数据?

SAINT 利用注意力机制同时考虑行和列信息,并使用先进的嵌入方法和自监督预训练,在有限标签数据下达到与传统机器学习方法(如 XGBoost)相当的准确率。

TUTA 模型如何统一预训练表格数据?

TUTA 通过二维坐标树结构描述表格的空间和层次信息,采用基于树的注意力和位置嵌入,并通过三个渐进式预训练目标进行预训练,提升了表格类型分类和单元格类型分类的效果。

CT-BERT 在跨表预训练中引入了什么机制?

CT-BERT 引入了对比学习和表格建模的目标,通过广泛的实证结果证明在监督和自监督设置下显著优于之前的方法。

TransTab 如何处理多个表格中部分重叠列的问题?

TransTab 将每个样本(行)转换为可推广的嵌入向量,然后应用堆叠的变压器进行特征编码,从而学习来自多个表格的机器学习模型,支持训练和测试期间使用多个具有部分重叠列的表格进行预测。

表格预训练模型在联合建模表格和文本时存在什么局限性?

现有工作通过自我学习目标函数和预训练语言模型对表格和相关文本进行联合建模,可以提高涉及配对表格和文本的任务的性能,但在没有任何相关文本的情况下处理表格的任务(如填充缺失单元格)时表现不佳。

🏷️

标签

➡️

继续阅读