SEMv3: 表格分隔线检测的快速稳健方法

💡 原文中文,约1700字,阅读约需4分钟。
📝

内容提要

本文介绍了多种表格结构识别方法,如分割、嵌入和合并(SEM)、TSRFormer、RobusTabNet等。这些基于深度学习的技术提高了表格检测和结构识别的准确性与效率,并在多个基准数据集上取得了最先进的表现,推动了文档分析的发展。

🔎

延伸解读

技术演进脉络

从2021年的SEM到2024年的端到端半监督方法,表格结构识别技术经历了从多模块组合到端到端学习、从全监督到半监督的演进。SEM通过分割、嵌入、合并三部分识别表格内部结构;TSRFormer将分隔线预测转化为线性回归问题;TRUST基于Transformer分解为行/列分割和网格合并。这些方法在多个基准数据集上取得最先进表现,推动了文档分析的发展。

半监督学习的突破

半监督表格检测通过新型匹配策略提高伪标签质量,在早期阶段显著提升训练效率。在TableBank和PubLayNet数据集上,仅使用30%标签数据即达到95.7%和97.9%的mAP,较之前方法分别提升7.4和7.6个百分点。这表明半监督方法能大幅减少标注需求,为实际文档分析任务提供更高效准确的解决方案。

性能提升与评估

各方法在基准数据集上不断刷新记录。TSRFormer在多个基准上取得最先进表现;TRUST在PubTabNet上达到每秒10帧的速度;改进的Cascade R-CNN在SciTSR、FinTabNet和PubTables1M数据集上结构TEDS分别提升19.32%、11.56%和14.77%。这些进展显示表格识别在准确性和效率上的双重提升。

❓

Q&A

SEM模型的主要组成部分是什么?

SEM模型由分割器、嵌入器和合并器三部分组成。

TSRFormer是如何预测表格分隔线的?

TSRFormer使用线性回归问题来预测表格的分隔线。

RobusTabNet的主要功能是什么?

RobusTabNet能够检测表格边界并重建细胞结构。

Multi-Type-TD-TSR方法的优势是什么?

Multi-Type-TD-TSR提供了端对端的表格检测和结构识别解决方案,提升了技术进展。

TRUST方法是如何优化表格结构识别的?

TRUST方法将表格结构识别分解为行/列分割和网格合并两个子任务进行优化。

半监督表格检测器的创新点是什么?

半监督表格检测器通过新型匹配策略提高伪标签质量,显著提升训练效率。

🏷️

标签

➡️

继续阅读