多模态融合,大模型时代下的智能硬件新玩法

💡 原文中文,约1600字,阅读约需4分钟。
📝

内容提要

小米SU7发布会介绍了多模态交互方案,结合车辆位置和摄像头实现感知多模态融合和实时语音交互。使用端侧轻量级AI+云端大模型结合的方式,通过硬件端进行图像采集和语音交互的预处理,再通过网络传到云端进行进一步处理。开发者可使用聆思CSK6大模型开发板配套的SDK进行开发。聆思平台是为大模型开发设计的云平台,提供定制大模型应用和产品管理功能。

🔎

延伸解读

端云协同:智能硬件的务实选择

文章指出,汽车等设备资源丰富,可运行端侧大模型,但日常智能硬件资源有限,因此采用端侧轻量级AI与云端大模型结合的方式。端侧负责图像采集和语音交互的预处理,云端进行进一步处理,结果再回传硬件执行。这种分工降低了对硬件算力的要求,使多模态交互在资源受限的设备上成为可能。

开发门槛的降低:SDK与开发板的作用

从零开始进行大模型云端应用和嵌入式开发门槛高、耗时久,且交互效果优化不易。聆思CSK6大模型开发板配套的SDK已对接星火认知大模型,并实现了十几种端侧AI能力。开发者只需基于SDK二次开发,通过四步操作即可完成具备拍照识图和语音交互功能的DEMO,这显著降低了多模态应用的开发门槛。

云端服务流程:从语音到响应的链路

文章详细描述了云端服务流程:设备识别语音输入后,先下发“我知道了”等反馈,再将识别内容结合上下文进行语义改写,通过大模型进行意图落域,根据结果分别处理,最后将响应文本合成TTS输出。这一流程展示了多模态交互中云端处理的分工与顺序,有助于开发者理解系统各模块的协作方式。

聆思平台:全链路开发与产品管理

聆思平台是专为大模型全链路开发落地设计的云平台。开发者可在云端定制专属大模型应用,如企业知识库、文生图、图生文,并接入企业内部服务。平台还提供固件OTA、设备白名单管理等产品管理功能,便于产品上市后的维护和管理。这为开发者提供了从开发到运维的一体化支持。

❓

Q&A

小米SU7的多模态交互方案是如何实现的?

小米SU7的多模态交互方案结合车辆位置和摄像头,通过端侧轻量级AI与云端大模型的方式进行感知和实时语音交互。

开发者如何使用聆思CSK6大模型开发板进行开发?

开发者可以使用配套的SDK,通过简单的四步操作完成具备拍照识图和语音交互功能的大模型开发板DEMO。

聆思平台提供哪些功能?

聆思平台为大模型开发提供全链路支持,允许定制应用、产品管理功能,如固件OTA和设备白名单管理。

多模态交互的SDK业务流程是怎样的?

SDK业务流程包括语音或视觉信息的预处理、云端分析和后处理,最终生成适合开发板执行的内容。

聆思科技的CSK6系AI芯片有什么特点?

聆思科技的CSK6系AI芯片专注于智能终端系统级芯片,已适配Zephyr RTOS,支持多种端侧AI能力。

如何实现多模态交互的拍照识图和语音功能?

通过将多模态DEMO固件烧录到开发板,并输入WiFi账号密码后,重新上电即可使用拍照识图和语音交互功能。

🏷️

标签

➡️

继续阅读