人力资源技术的下一个前沿领域:语音、视频和多模态AI

人力资源技术的下一个前沿领域:语音、视频和多模态AI

💡 原文中文,约1200字,阅读约需3分钟。
📝

内容提要

该文章预测,未来两到三年内,人机交互将主要转向语音和视频界面,而非文本输入。多模态AI模型日益普及,能整合感官输入,推动这一趋势。到2030年,80%企业软件将实现多模态交互,成本大幅下降,性能提升,企业应集成这些功能以提升效率和创新。

🔎

延伸解读

多模态AI成本骤降,企业集成门槛降低

文章引用麦肯锡数据指出,训练一个多模态模型的成本已从2022年的10万美元降至不到2000美元,降幅巨大。这意味着企业采用多模态AI的经济门槛大幅降低,即使是中小型企业也可能负担得起。但需注意,成本下降主要针对模型训练,实际部署、维护和定制化仍需额外投入,企业应综合评估总拥有成本。

文本交互不会消失,多模态是补充而非替代

尽管多模态AI发展迅速,但IEEE报告并未显示文本交互将消失。Gartner预测到2030年80%企业软件将实现多模态交互,但文本仍是基础交互方式之一。企业应避免盲目追求全语音或视频界面,而应根据场景选择最合适的交互方式,例如在嘈杂环境或需要记录的场景中,文本可能更高效。

多模态AI在HR领域的应用尚处早期,需关注实际效果

文章提到人力资源执行团队注意到语音工具使用率上升,但多模态AI在HR领域的应用仍处于早期阶段。目前多数多模态模型仅能处理两到三种模态,功能有限。企业应谨慎评估供应商的宣称,通过试点项目验证实际效果,并关注数据隐私和员工接受度等潜在风险。

Q&A

未来两到三年内,人机交互的主要方式将发生什么变化?

根据IEEE Future Directions的报告,未来两到三年内,人们将越来越多地通过具备认知能力的语音和视频界面与AI互动,而不是主要依赖文本输入。

多模态AI模型是什么?为什么它们能推动人机交互的变革?

多模态AI模型能够整合多种感官输入(如文本、图像、声音),模拟大脑整合感官信息的能力,从而形成对世界的整体理解。它们能感知多种输入并产生输出,因此能以创新和变革性的方式与世界互动,推动人机交互从文本转向语音和视频。

到2030年,企业软件中多模态交互的普及率预计会达到多少?

根据Gartner的预测,到2030年,80%的企业软件和应用程序将实现多模态交互,而2024年这一比例不足10%。

多模态AI模型的成本近年来有何变化?

多模态AI模型的成本大幅下降。例如,索尼AI的研究人员证明,2022年训练一个模型需要花费10万美元,而现在不到2000美元。

企业应如何应对多模态AI的发展趋势?

Gartner分析师Roberta Cozza建议,企业应专注于将多模态功能集成到其软件中,以提升用户体验和运营效率,通过利用多模态GenAI提供的多样化数据输入和输出,释放更高水平的生产力和创新能力。

文本交互是否会因为语音和视频界面的兴起而消失?

根据IEEE的时间表,没有证据表明文本交互正在消失。尽管AI正快速向多模态方向发展,但文本交互仍将存在。

🏷️

标签

➡️

继续阅读