本文介绍了SlowFast-LLaVA-1.5(SF-LLaVA-1.5),一种高效的视频大语言模型,专注于长视频理解。该模型结合了SlowFast机制和联合视频-图像训练,在1B和3B规模下表现出色,满足移动友好模型的需求。实验结果显示,SF-LLaVA-1.5在多个视频任务上表现优异,尤其在长视频理解方面达到了最先进水平。
本文探讨了通过知识隔离和联合训练提升视觉-语言-动作模型(VLA)性能的方法。研究表明,传统训练方法导致知识损失和推理速度慢。作者提出的知识隔离技术有效保护预训练模型知识,同时使模型适应机器人控制任务,从而加快训练和推理速度。
本研究提出了一种结合不平衡感知技术的联合训练基准,以解决少样本增量学习中的类别不平衡问题,缩小基础类与增量类的性能差距,并规范了实验设置与评估流程。
本研究提出了一种两阶段通用策略框架,结合扩散规划者和逆动力学模型,以解决智能体在多种决策任务中的适应性问题。实验结果显示,联合训练不同智能体的数据集可提高任务完成精度,最高提升42.20%。
本研究提出了一种教师与学生联合训练框架,解决了在特权模仿学习中学生因部分可观测性而无法有效模仿教师的问题。实验结果表明,该方法在复杂的四旋翼任务中表现显著。
本研究提出了一种新颖的联合训练方法,解决了选择性预测中模型输出信任度不足的问题。结果表明,该方法在预测结果和模块性能上均优于两个强基线。
本文研究了低资源语言中的视觉关键词检测,提出了多种模型和方法,包括视觉语音联合训练和基于注意力机制的模型,以提高关键词定位精度。研究表明,结合高资源语言知识可以有效提升低资源语言的表现,并探讨了在真实环境中的应用挑战。
本文介绍了一种联合训练的多器官分割模型,利用少量器官数据集和软标签减少噪声,实验结果表明其性能优于现有方法。此外,研究探讨了自我监督学习和对比学习在医学成像中的应用,提出了多教师单学生知识蒸馏框架和新损失函数,显著提升了分割任务的效果。
近年来,端到端(E2E)自动语音识别(ASR)模型在深度学习架构的推动下取得了显著进展。研究者通过与音素模型的联合训练,显著提高了模型的准确性。本文提出了一种高效的联合训练方法,利用多样化建模单元,进一步增强了模型的准确性,为开发更强大的ASR系统提供了新思路。
本文介绍了mPLUG-DocOwl模型,该模型基于mPLUG-Owl,通过联合训练语言、视觉和文档指令数据,提升了OCR-free文档理解能力,并构建了评估集LLMDoc。实验结果表明,该模型在多项任务中优于现有模型,展现出良好的泛化能力。
本文介绍了RoSA,一种新型参数高效调整方法,通过联合训练低秩和高度稀疏的组件,有效逼近全精调解决方案的性能。RoSA在挑战性生成任务中表现优于LoRA和纯稀疏调整,且具备高效训练的内存和计算支持。
该研究提出了一种新型混合动作基元架构和联合训练方法,实现了在小语料库中从语音到手语的翻译。相较于从原始手语表现形式到手语的翻译,完整的从口语到手语的翻译流水线表现更好。
该文介绍了DiffPrompter,一种新颖的可微分的视觉和潜在提示机制,用于自动驾驶系统中的恶劣天气场景的语义分割任务。作者证明了该方法在物体分割任务中的有效性和优越性,并研究了联合训练视觉和潜在提示的优势。
该论文提出了一种评估口头表达一致性的方法,通过联合训练多种任务的模型,提高了评估一致性的性能,为大规模自动评估提供了基础。
该研究提出了一种联合训练方案,包括可微分的DPR集成答案生成,以端到端的方式进行训练。实验表明,该方案优于最近的OK-VQA系统。同时,引入了新的诊断指标来分析检索和生成之间的交互作用,模型的强大检索能力显着降低了训练所需的检索文档数量,从而在答案质量和训练所需的计算方面产生了显着的收益。
完成下面两步后,将自动完成登录并继续当前操作。