内容提要
该文章预测,未来两到三年内,人机交互将主要转向语音和视频界面,而非文本输入。多模态AI模型日益普及,能整合感官输入,推动这一趋势。到2030年,80%企业软件将实现多模态交互,成本大幅下降,性能提升,企业应集成这些功能以提升效率和创新。
延伸解读
多模态AI成本骤降,企业集成门槛降低
文章引用麦肯锡数据指出,训练一个多模态模型的成本已从2022年的10万美元降至不到2000美元,降幅巨大。这意味着企业采用多模态AI的经济门槛大幅降低,即使是中小型企业也可能负担得起。但需注意,成本下降主要针对模型训练,实际部署、维护和定制化仍需额外投入,企业应综合评估总拥有成本。
文本交互不会消失,多模态是补充而非替代
尽管多模态AI发展迅速,但IEEE报告并未显示文本交互将消失。Gartner预测到2030年80%企业软件将实现多模态交互,但文本仍是基础交互方式之一。企业应避免盲目追求全语音或视频界面,而应根据场景选择最合适的交互方式,例如在嘈杂环境或需要记录的场景中,文本可能更高效。
多模态AI在HR领域的应用尚处早期,需关注实际效果
文章提到人力资源执行团队注意到语音工具使用率上升,但多模态AI在HR领域的应用仍处于早期阶段。目前多数多模态模型仅能处理两到三种模态,功能有限。企业应谨慎评估供应商的宣称,通过试点项目验证实际效果,并关注数据隐私和员工接受度等潜在风险。
Q&A
未来两到三年内,人机交互的主要方式将发生什么变化?
根据IEEE Future Directions的报告,未来两到三年内,人们将越来越多地通过具备认知能力的语音和视频界面与AI互动,而不是主要依赖文本输入。
多模态AI模型是什么?为什么它们能推动人机交互的变革?
多模态AI模型能够整合多种感官输入(如文本、图像、声音),模拟大脑整合感官信息的能力,从而形成对世界的整体理解。它们能感知多种输入并产生输出,因此能以创新和变革性的方式与世界互动,推动人机交互从文本转向语音和视频。
到2030年,企业软件中多模态交互的普及率预计会达到多少?
根据Gartner的预测,到2030年,80%的企业软件和应用程序将实现多模态交互,而2024年这一比例不足10%。
多模态AI模型的成本近年来有何变化?
多模态AI模型的成本大幅下降。例如,索尼AI的研究人员证明,2022年训练一个模型需要花费10万美元,而现在不到2000美元。
企业应如何应对多模态AI的发展趋势?
Gartner分析师Roberta Cozza建议,企业应专注于将多模态功能集成到其软件中,以提升用户体验和运营效率,通过利用多模态GenAI提供的多样化数据输入和输出,释放更高水平的生产力和创新能力。
文本交互是否会因为语音和视频界面的兴起而消失?
根据IEEE的时间表,没有证据表明文本交互正在消失。尽管AI正快速向多模态方向发展,但文本交互仍将存在。