美团技术团队将LLM语义表征应用于搜索排序,提升语义匹配能力。工程落地需关注成本、延迟、缓存和回滚,建议按场景灰度并拆分监控。跨场景复用可降本,但需明确边界和降级策略。普通团队应先小范围验证,列清延迟、更新频率、降级和监控四张表,视其为长期维护的基础设施。
本文比较了自回归语言模型(ARMs)与扩散语言模型(DLMs)的性能。DLMs通过并行生成令牌提高算术强度,但长上下文扩展不佳;块状解码可改善此问题。批处理推理中,ARMs因序列并行优势吞吐量更高。减少采样步数是DLMs降低延迟的关键。
本文介绍了LARYBench,一个用于评估隐式动作表征的基准系统,旨在提升机器人在不同环境中的泛化能力。LARYBench分析了大规模人类视频数据,提供超过一百万段标注视频,涵盖151种动作,支持多样化的机器人形态和操作场景。实验结果表明,通用视觉模型在动作泛化和控制精度上优于专门模型,强调了隐式动作表征的重要性。
苹果将在2026年国际学习表征会议(ICLR)上展示基于M5 Max的本地LLM推理和SHARP处理图像的研究,会议时间为4月23日至27日,地点在巴西里约热内卢,欢迎研究社区参与。
AI Shortlist 是一篇关于人工智能的文章,探讨了其技术、应用及发展趋势,分析了AI在各领域的影响及未来潜力。
抱歉,文本内容过于简短,无法进行有效总结。请提供更详细的文章内容。
最新研究表明,视觉模型与人脑的相似性受模型大小、训练数据量和图像类型的影响。DINOv3模型在训练中逐步与人脑表征一致,尤其在使用人类相关图像时效果最佳。研究发现,模型学习的表征层级与大脑结构高度一致,不同特征的出现速度也存在差异。
Qwen3 Embedding 系列模型正式发布,专注于文本表征与排序任务,基于 Qwen3 训练,性能卓越。支持100多种语言,提供多种参数配置,灵活满足不同需求。模型采用分阶段训练,提升泛化能力与任务适配性,未来将扩展多模态表征能力。
机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。
机器之心数据服务现已上线,提供高效稳定的数据获取服务,简化数据爬取流程。
本研究探讨深度神经网络的可解释性,提出从几何角度理解特征与数据分布的关系。结果表明,特征可分为上下文特征、成分特征和表面特征,为机制可解释性提供了新见解,并指引未来研究方向。
Meta近期发布了WebSSL模型,探索无语言视觉自监督学习的潜力。该模型在大规模图像数据集上训练,展现了在视觉问答和OCR等任务中的竞争力,挑战了语言监督的重要性,并强调了数据集组成和模型规模的影响。WebSSL为未来的多模态系统提供了开源基础。
本研究提出了一种统一的信息论方程,概括了表征学习中多种损失函数的多样性。研究发现多种机器学习方法能够最小化KL散度积分,支持聚类、谱方法和对比学习,并开发了新损失函数,使ImageNet-1K的无监督分类性能提升超过8%。
苹果研究人员通过基础研究推动机器学习和人工智能的发展,并在国际学习表征会议(ICLR)上展示深度估计、文本生成和决策制定等领域的创新研究,以支持更广泛的研究社区。
苹果将在4月24日至28日于新加坡举行的国际学习表征会议(ICLR)上展示新研究,设立展位C03,进行技术演示并参与论文工作坊。
该研究关注如何理解和减轻大型语言模型(LLMs)在高风险决策中的偏见问题。通过引入招生和招聘决策任务,研究发现现有模型表现出明显的种族偏见,且多种提示策略无法消除这些偏见。研究还提出了一种新的方法,通过识别模型激活中的“种族子空间”来干预决策,结果表明这一方法能够显著减少偏见,虽然种族表征的普遍性仍面临挑战。
在ICLR 2025会议上,ChartMoE论文被录取为口头报告。该模型通过多阶段对齐任务增强图表理解能力,采用MoE结构,显著提升视觉表征和性能。研究表明,ChartMoE在通用和图表领域均表现优异,减少了对通用知识的遗忘。
本研究解决了眼科医生在诊断中面临的多模态数据不足和隐私问题。提出的精髓点与解耦表征学习(EDRL)策略通过自蒸馏机制改进特征选择和解耦,从而在眼科疾病诊断中实现更强的鲁棒性和可解释性。实验结果显示,EDRL策略在多模态眼科数据集上的表现优于当前最先进的方法。
本研究解决了大语言模型在预测和可处理性方面的不足,通过对比输入样本的利用,进行高层次概念表征的检测与编辑。论文提供了表征工程的目标与方法的系统性框架,并提出了未来的研究议程,以实现更可预测、安全和个性化的大语言模型。
完成下面两步后,将自动完成登录并继续当前操作。