FALCON:打破界限,粗粒度标签的无监督细粒度类别推断,已开源| ICML'24 - 晓飞的算法工程笔记
内容提要
FALCON是一种无需细粒度级别监督的方法,可以从粗粒度标记数据中发现细粒度类别。它通过结合粗粒度和细粒度类别之间的关系来恢复粗粒度预测,并使用粗粒度监督和细粒度的伪标签来训练细粒度分类器。实验结果表明,FALCON在图像分类和单细胞分类任务上优于基线方法。
延伸解读
无需细粒度标签的类别发现
FALCON 的核心创新在于仅使用粗粒度标签就能发现细粒度类别,无需任何细粒度监督。传统方法需要预先定义细粒度类别并获取少量标注样本,而 FALCON 通过交替优化推断粗细类别关系并训练分类器,自动发现细粒度类别。这降低了标注成本,适用于细粒度标注困难的领域,如生物细胞分类。
交替优化与伪标签机制
FALCON 采用交替优化策略:固定类别关系训练细粒度分类器,再固定分类器推断类别关系。训练中引入最近邻一致性损失和置信度损失,利用 EMA 模型生成伪标签,鼓励同一粗类内细粒度预测一致且自信。同时使用最大熵正则化避免退化解,确保细粒度类别充分分离。
多数据集兼容与性能表现
FALCON 能无缝整合多个具有不同粗粒度标签体系的数据集,通过为每个数据集学习特定的类别关系矩阵,共享细粒度分类器。在 tieredImageNet 上,FALCON 比最佳基线提升 22%,处理超过 600 个细粒度类别。在单细胞 PBMC 数据集上也表现优异,展示了跨领域适用性。
实际应用与限制
FALCON 适用于图像分类和单细胞分类等场景,尤其当细粒度标签获取需要领域专业知识时。但方法假设每个细粒度类别有唯一粗粒度父类,且需预先知道或估计细粒度类别数量。对于类别关系复杂或层次结构不明确的数据,可能影响性能。未来可探索更灵活的类别关系建模。
Q&A
FALCON的主要功能是什么?
FALCON是一种无需细粒度监督的方法,可以从粗粒度标记数据中发现细粒度类别。
FALCON如何训练细粒度分类器?
FALCON使用粗粒度监督和细粒度伪标签来训练细粒度分类器,并通过交替优化推断类别关系。
FALCON在实验中表现如何?
实验结果表明,FALCON在图像分类和单细胞分类任务上优于基线方法,特别是在tieredImageNet数据集上超过最佳基线22%。
FALCON如何处理不同数据集的粗粒度标签?
FALCON能够无缝地适应和利用具有多个数据集的不兼容粗粒度类别,进行有效学习。
细粒度标签获取的挑战是什么?
细粒度标签的获取通常需要领域专业知识和繁琐的人工努力,且现有方法无法有效利用粗粒度标签。
FALCON的优化过程是怎样的?
FALCON通过交替优化推断粗粒度和细粒度类别之间的关系,并训练细粒度分类器。