Fable 5 Vision使AI具备了“设计师的眼睛”,能够自我纠错并主动验证输出结果,精准解析复杂图表和UI,自动化检查并修改代码,显著降低开发者沟通成本。这标志着智能体的进化,提升了视觉能力,使其成为能够感知和修正自身行为的自主系统。
清华教授唐杰讨论了人工智能(AI)发展,强调通用人工智能(AGI)的重要性,并征集用户对GLM-5.3的需求。用户希望增加视觉能力以提升模型实用性。尽管智谱已有多模态模型,但GLM旗舰版尚未整合视觉功能,面临竞争压力。唐杰指出,虽然视觉能力重要,但提升模型智能仍需复杂推理。
阿里巴巴发布了Qwen3.7-Plus多模态大模型,具备强大的文本和视觉能力,能够理解图片和视频,进行深度推理和自我编程,支持复杂任务的自动化。该模型已通过阿里云百炼提供API服务。
人类通过视错觉测试AI的视觉能力,发现AI无法识别浮动心形。尽管在某些方面有所改善,AI在处理视觉错觉时仍显不足,揭示了人类与AI在视觉处理机制上的根本差异。
谷歌推出Gemma 3 QAT系列,采用量化感知训练(QAT),将模型权重从16位量化至4位,保持高精度。该系列包括四种模型(1B、4B、12B、27B),可在低功耗硬件上运行,降低VRAM需求。同时,Gemma 3增强了视觉能力,用户反馈良好。模型权重可在HuggingFace等平台获取。
本研究评估了视觉语言模型(VLMs)在基础视觉概念理解方面的不足,发现其在物体识别上表现良好,但在方向和位置等低中级视觉能力上存在显著缺陷。
新方法OmniAlign-V解决了多模态语言模型在对齐人类偏好时视觉能力下降的问题。通过设计奖励模型和偏好数据集,该方法在视觉和语言任务中表现更佳,同时保持模型能力。
本研究评估了视觉语言模型(VLMs)在链接匹配视觉线索的能力,提出了VLM$^2$-Bench基准和9个子任务。研究发现现有模型表现不佳,GPT-4o的表现比人类低34.80%。呼吁增强模型的视觉能力以改善适应性。
CUA结合了GPT-4o的视觉和推理能力,能够在用户请求时启动虚拟主机,并实时同步操作。通过处理屏幕截图,CUA执行多步骤任务,适应变化并自我纠正,从而提高任务完成度。
OpenAI推出了Computer-Using Agent(CUA),这是一种智能代理,能够在数字世界中执行任务。CUA结合了视觉能力和强化学习,能够像人类一样与图形用户界面互动,完成多步骤任务。尽管CUA仍处于早期阶段,但在多个基准测试中表现出色,计算机任务成功率为38.1%,网页任务成功率为58.1%。CUA的设计注重安全性,旨在减少潜在风险。
谷歌新版Gemini(Exp 1114)超越OpenAI的o1,成为AI竞技场的领头羊,数学能力与o1相当,获得六项第一。尽管在编码和风格控制上表现不佳,但在视觉能力上领先。网友反馈褒贬不一,部分人质疑其是否为Gemini 2的预览版。
本文探讨了多模态大型语言模型(MLLMs)在视觉和语言任务中的表现,提出了“视觉描述提示法”和特征混合方法,以提升视觉能力。研究显示,现有模型在视觉推理和理解方面存在缺陷,准确率普遍低于50%。为此,开发了多个基准测试(如MMStar和MLLM-Bench),以评估模型在复杂任务中的能力,推动多模态系统的进步。
本文研究自然语言交互与认知机器人结合应用,旨在提高日常任务效率。综述了对话系统的发展、操作、训练数据及面临的挑战,指出语音对话技术设计不足,影响自然对话。提出了优化人机交互的框架,结合视觉能力与对话系统,展望未来更丰富的对话体验。
研究发现,CLIP和DINO在细粒度任务和MLLMs中表现出优势和有希望的性能。研究提出了特征融合策略COMM,将CLIP和DINO结合起来,增强MLLMs的视觉能力。实验证明COMM在MLLMs中具有卓越性能。
OpenAI的ChatGPT视觉能力开启了新篇章,开发者们探索视觉理解与对话AI的结合。作者创建了一个多模态原型应用,利用KOSMOS-2进行图像描述,并结合Google的PaLM API实现深度对话。该应用允许用户上传图像并进行实时互动,界面友好,旨在推动视觉语言应用的发展。
研究发现,CLIP和DINO在MLLMs中具有优异的性能,提出了一种特征融合策略COMM以增强视觉能力,实验证明其具有卓越性能。
完成下面两步后,将自动完成登录并继续当前操作。