在OpenAI Voice Hack Night活动上,开发团队展示了“Agentic操作系统”原型,该系统通过AI即时生成界面,用户可通过语音指令完成复杂操作,如预订机票和发送邮件。OpenAI计划在2027年上半年实现该手机项目的量产,标志着操作系统设计的重大变革。
YoooClaw C·ONE是一款新型智能卡片,旨在提升AI助手的使用体验。它可连接手机,整理通知,生成待办事项,并通过语音指令简化操作。用户可长按说话记录灵感或指挥AI执行任务,具备录音和转写功能,适合会议和讨论。此次众测活动邀请用户体验并反馈其在工作流中的实际应用。
本文介绍了如何使用MCP工具通过语音指令控制LS26(Arcs-mini)开发板上的MG90S舵机。用户可以通过四次点击按钮启动或停止舵机旋转,并通过云端调用MCP工具设置旋转方向和速度。教程包括硬件接线、代码实现及常见问题解决方案,适合初学者。
本文探讨了一种双执行体强化学习框架,结合人类反馈优化视觉-语言-动作(VLA)模型。通过“对话与微调”机制,机器人在长时域操作中实现高效学习,成功率达到100%。该方法在多任务设置中展现出良好的样本效率和训练稳定性,适用于复杂的机器人操作任务。
三星与谷歌推出的Galaxy S26系列搭载Gemini智能体,支持通过语音指令打车和点外卖。目前该功能在美国和韩国预览,未来将扩展至更多设备。Gemini结合AI读屏和API,模仿人类操作,提升用户体验,尽管功能尚有限,但谷歌生态系统将促进其发展。
本文介绍了一种适用于高温、高湿工业环境的C#离线语音指令系统。该系统利用Windows语音引擎,实现设备控制和参数设置,确保数据安全和快速响应。支持多种语音指令,资源占用低,识别率高,适合无法触控的场景,提升操作效率。
IAI Smart推出了Emerson Smart系列智能家电,支持语音控制,无需Wi-Fi或应用程序。产品包括塔扇、加热器、电源插头和空气炸锅,内置麦克风和扬声器,能响应超过1000个语音指令,确保用户隐私安全。这些产品在Best Buy、Walmart和Amazon等平台上销售。
豆包手机助手通过深度整合操作系统,简化手机操作,能够高效处理复杂任务,如文件管理和比价购物。用户只需通过语音指令,助手便可自动执行,提升生活便利性,实现智能化交互。
Bitmovin推出Agentic AI Hub,旨在简化视频工作流程并提升观众体验。该平台结合新工具和AI场景分析,支持自然语言生成短视频,优化VoD编码器,便于内容推广至TikTok等平台,用户可通过语音指令与内容互动,提供更自然的观看体验。
美团的智能秘书“小美”通过语音指令简化生活服务,如点外卖和找餐厅,操作简单,适合各年龄层用户。它利用真实数据和强大模型提供个性化推荐和智能提醒,增强用户体验。
现代机器人吸尘器已具备吸尘和拖地的双重功能,部分型号支持自动清理垃圾和水箱,且可通过语音指令操作。市场上有多款性价比高的选择,如iRobot的Roomba Combo j7 Plus和Yeedi Cube,适合不同预算的消费者。
智谱推出全球首个手机通用Agent,用户可通过语音指令让手机自动执行任务,如点外卖和比价。该Agent在云端运行,不占用本地资源,支持安卓和iOS,并可集成到智能音箱等设备,推动通用人工智能的发展。
Spotify的AI DJ功能现已支持语音指令,Premium用户可以通过语音请求播放特定艺术家或风格的音乐。用户只需按住“DJ”按钮并发出指令,如“播放电子音乐”或“给我一些独立曲目”,从而更好地控制播放内容。
本研究提出了一种基于大型语言模型的虚拟现实搬运工具,旨在自然支持物体操作。该工具理解用户语音指令,提升用户体验和多物体操作表现,减少工作负担和手臂疲劳,为未来物体操作界面设计提供重要启示。
一名开发者在 Reddit 展示了一个基于 ChatGPT 的自动步枪炮台,能够快速响应语音指令进行射击。因违反 OpenAI 使用协议,该开发者的账号被封禁,此事件引发了对人工智能武器化的担忧。
无问芯穹于12月16日开源了全球首个端侧全模态理解模型Megrez-3B-Omni,该模型具备图片、音频和文本处理能力,参数为30亿,推理速度领先300%。在多个基准测试中表现优异,支持语音指令和网页搜索,旨在提升端侧智能设备的性能与效率。
国产AI AutoGLM实现手机和电脑网页的自动操作,用户可通过语音指令完成点赞、发微信、点外卖等功能,简化了操作流程,标志着AI向自动化发展。
本研究提出了一种新型语音理解模型,结合少量语音数据与大量文本数据,验证了其在语音识别和翻译任务中的有效性。该模型利用预训练的语言模型,在多任务和多语种环境中表现出色,具备零-shot能力,能够在低资源语言上实现良好性能,展示了构建高效语音语言模型的潜力。
本文介绍了一个用于提升机器人与人类互动能力的数据集,测试了多种视觉和语言模型,但结果不理想。提出了一种新型交互式导航模型,表现优于其他模型,并探讨了多模态语言模型在机器人任务中的应用,强调了非语言暗示和语音指令在交互中的重要性。
Qwen2-Audio是新发布的多模态音频语言模型,支持语音指令和音频分析,能够处理超过8种语言。该模型在语音聊天、音频分析和多语言支持方面表现优异,未来将进行更大规模的训练以提升性能。
完成下面两步后,将自动完成登录并继续当前操作。