DeepSeek悄然上线视觉模型V4-Flash-Vision-Exp,价格与文本版持平,图片按Token计费,纯文本能力不变,多模态Agent能力大幅提升,但部分测试有退步。此举旨在让Agent“看见”屏幕,提升效率,同时开放Files API构建生态。实验性质或为商业策略,引发开发者对性价比和潜在涨价的讨论。
本文介绍了LARYBench,一个用于评估隐式动作表征的基准系统,旨在提升机器人在不同环境中的泛化能力。LARYBench分析了大规模人类视频数据,提供超过一百万段标注视频,涵盖151种动作,支持多样化的机器人形态和操作场景。实验结果表明,通用视觉模型在动作泛化和控制精度上优于专门模型,强调了隐式动作表征的重要性。
本文介绍了一种名为“链式草图”(CoS)的方法,旨在提高视觉模型在全球推理任务中的学习效率。研究发现,现有的大型视觉模型和多模态语言模型在这些任务上表现不佳。CoS通过将复杂任务分解为中间视觉步骤,帮助模型更好地学习。同时,引入的“归纳CoS”结构在小模型中也能实现更好的泛化能力。
近两年,AI迅速发展,普通人主要应用于对话和生图。文章介绍了AI大模型的类型,包括语言模型、向量模型、视觉模型和多模态模型,以及获取和使用的方法。熟练掌握AI将成为未来必备技能。
认知科学家收集了包含数百万个“奇异物体”判断的THINGS数据集,但仅使用几千张图像进行微调,导致模型过拟合并遗忘先前技能。
最新研究表明,视觉模型与人脑的相似性受模型大小、训练数据量和图像类型的影响。DINOv3模型在训练中逐步与人脑表征一致,尤其在使用人类相关图像时效果最佳。研究发现,模型学习的表征层级与大脑结构高度一致,不同特征的出现速度也存在差异。
Ollama社区在五月发布了三项重要更新,推出了多模态引擎,支持视觉模型,提升了AI能力和用户体验。同时新增工具调用功能和“思考”模式,增强了交互性和透明度。这些更新进一步推动了Ollama在本地化AI领域的发展。
该研究提出了FORTRESS框架,旨在解决大型视觉和语言模型在处理分布外故障时的推理延迟问题,实时生成安全后备策略,从而提高系统安全性和规划成功率。
本研究提出了VISLIX框架,用于验证视觉模型,解决数据切片方法中的挑战,如缺乏图像元数据。VISLIX能够自动生成自然语言洞察,支持用户与数据切片假设的互动测试,从而提升对象检测模型的验证过程。
本研究提出了Seg2HOI框架,结合视觉模型与人机交互任务,能够有效生成分割掩膜的四元组,其性能与先进方法相当,具有良好的应用潜力。
香港大学研究团队提出的新型视觉基础模型OverLoCK,结合了人类视觉的“纵观全局-聚焦细节”机制。在多个数据集上表现优异,特别是在ImageNet-1K上达到84.2%的准确率,超越现有卷积网络和Transformer,展现出强大的动态建模能力。
本研究提出了LEAVS,一个针对腹部CT报告的标注器,能够为九个腹部器官标注七种异常,其性能显著优于其他标注器和人类,提取的标签可用于训练视觉模型。
本研究提出CREStE方法,解决长距离无地图导航问题,使机器人在新环境中无需高精度地图。该方法利用互联网规模数据训练的视觉模型,学习环境特征,并通过反事实损失和主动学习进行路径规划,显著提高导航效果,减少70%人为干预。
Open-CUAK是一个开源替代OpenAI Operator的产品,支持本地托管,适用于多种视觉模型,提供可靠的自动化解决方案,帮助用户高效管理和监控任务,避免高昂的SaaS费用。
该研究探讨了视觉模型在时间序列分析中的应用,介绍了将时间序列编码为图像的建模方法,分析了预处理和后处理的挑战及未来发展方向。
阿里云发布的新视觉模型Qwen2.5-VL包含三个版本,旗舰版在13项评测中超越GPT-4o和Claude3.5。该模型能够准确解析图像和视频,支持复杂操作,如发送祝福和订票,并在视觉理解、文档解析和动态视频处理方面有显著提升,开发者可基于此模型创建AI智能体。
本研究提出了一种新颖的Group Sparse LoRA (GS-LoRA)方法,有效解决了在隐私和安全方面删除预训练视觉模型中不必要信息的问题。实验结果表明,该方法在面部识别、物体检测和图像分类任务中实现了信息遗忘,影响最小。
本研究探讨了数据集多样性对视觉模型性能的影响,发现准确性与数据多样性之间存在显著正相关,强调了理解数据集在构建更强大、可泛化模型中的重要性。
ColPali是一种视觉模型,支持在图像中进行文本搜索,快速定位PDF中的相关页面。为降低计算需求,开发了可量化的onnx版本。Vision RAG通过将图像存储为多向量嵌入,简化信息检索,避免了传统RAG的文本分块问题。使用EmbedAnything库,可以将PDF转换为多向量嵌入并计算查询相似度。
智源研究院发布2024年大模型评测结果,涵盖语言和视觉等多模态模型。新增金融量化交易能力,显示国内模型在复杂任务上仍有差距。字节跳动和百度的语言模型表现突出,视觉模型逐渐缩小与闭源模型的差距,但仍需提升。整体来看,大模型能力明显提升,但实际应用中仍需改进。
完成下面两步后,将自动完成登录并继续当前操作。