LensVLM是一种推理框架,旨在提升视觉语言模型(VLM)在压缩图像上的表现。该方法通过选择性扩展相关图像,保持高达4.3倍的有效压缩精度,超越传统的文本和视觉压缩基线。在多模态文档和代码理解任务中,随着压缩增加,准确性显著提升。
Velox是一个学习4D物体几何和外观的框架,通过压缩时空彩色点云生成动态形状标记。它使用两个解码器来监督这些标记,分别捕捉几何和外观,表现出色于视频生成、3D跟踪和图像生成等任务。
本文介绍了一种视觉自监督学习方法——文本条件JEPA(TC-JEPA),该方法通过图像标题减少特征预测的不确定性。TC-JEPA利用细粒度文本调节器,使图像特征更具语义意义,从而提升下游任务的表现和训练稳定性。该方法在视觉理解和推理任务中优于对比学习,展示了新的基于特征预测的视觉-语言预训练范式。
PEP 833提议冻结简单仓库API的HTML表示,认为其已完成,不应再更新。未来的PEP应专注于JSON表示。HTML表示在Python打包生态中发挥了重要作用,但存在扩展困难和兼容性问题。此PEP旨在正式化现状,未来不应修改HTML表示。
微软推出Harrier-OSS-v1,包含三种多语言文本嵌入模型,支持32,768词元的长上下文,采用解码器架构,需指令调优以提升检索性能。在多语言MTEB v2基准测试中表现优异。
Outlook将更新HTML邮件中内联图像的表示方式,采用“blob” URL并移除附件ID。开发者需调整解析逻辑,使用<img>标签的新custom-id属性来匹配内联图像与附件ID。此更改将在2025年10月31日前生效。
本文介绍了一种新框架MAPLE(基于偏好的模态对齐学习),通过多模态大语言模型(MLLM)指导跨模态表示学习。MAPLE利用MLLM的细粒度对齐先验,采用强化学习方法构建自动偏好数据,并引入相对偏好对齐损失(RPA),显著提升了跨模态检索效果,尤其在处理细微语义差异方面表现突出。
苏黎世联邦理工学院与卡内基梅隆大学提出了一种新型数据驱动的多视角3D点追踪方法,能够在动态场景中通过少量相机实现鲁棒且精确的在线追踪,有效应对遮挡和复杂运动问题。
本文探讨了非负矩阵分解(NMF)在音频信号处理中的应用,提出将NMF扩展到不规则采样的时频表示,如常数Q变换和小波分析。研究表明,NMF通过可学习函数能够处理更广泛的信号类别。
CIDR表示法用于表示网络段,如192.168.0.0/24。路由设备通过网络掩码匹配地址,ipcalc工具可计算IP范围。IP Glob使用*通配符匹配IP部分,类似于文件名匹配。IPSet是IP地址和CIDR的集合,用于配置ACL。
跨语言迁移是一种提升低资源环境下NLP任务训练数据的方法。本文分析了263种语言在词性标注、依存解析和主题分类等任务中的迁移情况,发现语言相似性对迁移性能的影响受任务、输入表示和相似性定义等因素的制约。
本研究提出了一种新型多模态掩码自编码器EmbodiedMAE,旨在缩小机器人操控中训练数据与实际任务之间的领域差距。该模型通过学习RGB、深度和点云表示,在DROID-3D数据集上进行训练,实验结果显示其在70个仿真任务和20个现实任务中表现优异,展现出良好的桌面操控应用潜力。
本研究提出了一种名为WiMAE的无线掩蔽自编码器基础模型,专注于多天线无线信道数据集的自监督学习。通过结合对比学习与重构任务,开发的ContraWiMAE显著提升了模型的表示能力和数据效率,为无线信道表示学习奠定了基础。
本研究提出了一种校准方法(RepCali),有效解决了微调预训练语言模型时编码器与解码器输入差异的问题,显著提升了下游任务的性能。
本文介绍了SMUGGLER,一种新型层次神经网络架构,计算复杂度为O(n log n),能高效处理长序列。该模型通过字节级预测,消除了嵌入表和注意力瓶颈,显著降低内存需求,适用于消费级硬件,性能与更多参数的模型相当。
本研究解决了从视觉变换器中提取符号规则的挑战,提出了一个框架,通过引入稀疏概念层来实现这一目标。该方法不仅提高了分类准确性,还构建了基于逻辑的决策层,为可解释和可验证的神经符号人工智能奠定了基础。
本文针对如何将特征表示从大型教师模型转移到轻量级学生模型的问题,提出了一种新方法——感知一致性。该方法通过引入新的损失函数,关注特征空间中数据点间的相似性排名,使得学生模型能够更好地模仿教师模型对输入的感知。实验证明,该方法在特征表示转移方面的表现优于或与强基线方法持平。
本研究针对夜间无人机跟踪中的极端光照变化和视角变化带来的挑战,提出了一种新的跟踪框架DARTer。该框架通过动态特征混合器和动态特征激活器有效融合和激活多视角特征,显著提升了跟踪的准确性和效率。实验结果表明,DARTer在多项夜间跟踪基准测试中表现优越,显示出其在实际应用中的潜力。
本研究提出了一种可解释的机器学习框架,用于早期检测多药耐药性(MDR)。通过多变量时间序列分析,量化患者相似性,框架在ICU电子健康记录中验证达到81%的AUC,识别关键风险因素如抗生素使用和合并感染,展示了其在早期检测中的潜力。
随着人工智能系统复杂性增加,知识本体在AI中至关重要。它通过定义概念及其关系,提升机器推理和理解能力,促进语义理解和智能搜索。知识本体在医疗、金融等领域广泛应用,成为智能系统的基础。
完成下面两步后,将自动完成登录并继续当前操作。