LG回应电视监控用户指控,称电视不会持续录制或上传对话,唤醒词检测在本地处理,ACR、语音识别和广告功能均为可选且默认关闭。但报道显示电视仍长期记录环境对话,LG未回应数据收集范围、共享对象及隐私选项误导等质疑。
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前景说话人转录,强调数据构造需明确时间、能量、空间关系,模型应学会选择交互主体而非单纯降噪,推动ASR从内容识别走向场景理解。
Meta推出实时语音识别模型Muse Voice Transcribe,支持70多种语言、区分20多位说话者及长对话,在基准测试中词错误率3.1%,优于竞品。模型采用自适应延迟机制,通过强化学习平衡准确性与速度。API定价每小时0.18美元,但不开放权重。Meta因眼镜和Mac应用等产品需求,持续推动该技术发展。
Speechmatics 的 Linden 模型现可通过 LiveKit Inference 平台使用,开发者无需额外申请密钥即可快速切换。Linden 支持 55 种以上语言,擅长处理浓重口音、嘈杂环境和字母数字识别,提升语音智能体在真实场景中的转写准确性。boost.ai 已将其投入生产,LiveKit 提供统一 API 和计费,简化开发流程。
谷歌更新Gemini音频模型,推出3.5 Transcribe等新功能,可自动识别专业术语和85种以上语言,去除填充词,支持语音编辑和最多三人说话人识别。3.5 Live增强中断处理和实时视觉处理,实验版可逐步叙述推理过程。更新今日起面向macOS应用和部分Android用户推出。
腾讯发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度识别与语义理解,在通用识别、方言、上下文感知等维度提升。在开源和自建评测中WER领先,中文普通话3.34%、英语2.62%、粤语3.12%。已上线腾讯云API,元宝App免费体验。
腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview,基于Hy3大模型提升通用识别、方言覆盖、上下文理解及复杂环境鲁棒性,在开源和自建评测中WER表现领先。支持热词注入,适配专业场景,已上线腾讯云API,并集成于元宝App,免费提供语音输入服务。
AI语音代理利用语音识别、自然语言处理和机器学习技术,实现自然对话,自动处理客户咨询、预约等任务,提供全天候服务,降低运营成本并提升效率。广泛应用于医疗、房地产、电商和金融等行业,同时生成数据洞察,支持可扩展性和安全性,是现代客户互动的重要工具。
Deepgram与高通合作,将Nova-3语音识别模型优化至骁龙X系列NPU,实现设备端实时语音转文本,无需云端,降低延迟和隐私风险。该技术适用于汽车、AI PC、XR等场景,提升准确率(词错误率6.89%),支持多语言和定制,为离线语音交互奠定基础。
神州泰岳在上海WAIC展示了ava 2.0数字员工矩阵,包括企业协作平台ava me+、语音数字员工avavox和个人助手ava app。ava me+帮助企业组建数字员工团队,avavox整合语音识别与大模型能力,ava app具备长期记忆,记录用户偏好与目标。这三款产品覆盖企业、客户服务与个人助理场景。
NVIDIA 发布了 Audex,这是一个统一的音频-文本大型语言模型,具备理解和生成音频及语音的能力,同时保持文本智能。Audex 采用 30 亿参数的 MoE 结构,设计简洁,避免了多模态模型的性能退化,在文本和音频任务中表现优异,尤其在语音识别领域领先。尽管存在商业许可限制和音频理解能力不足等缺点,Audex 仍在多项任务中表现出色。
在物理 AI 的发展中,语音识别成为关键能力,机器需要理解语音指令、区分说话者并过滤噪音。远场语音识别在复杂环境中面临挑战,基于物理的声学建模可以提升语音识别性能。FFASR 排行榜为评估语音模型在真实条件下的表现提供了新方法,帮助开发者确保产品的可靠性和易用性。
Voicebox是一款开源的本地AI语音工具,具备语音克隆、文本转语音和语音识别功能。用户只需录制几秒钟的声音,即可生成多种语言的语音,且无需云端支持和费用。它支持多种语音引擎,适合制作有声书和播客,保护用户隐私,是传统付费服务的替代品。
阿里推出的Fun-ASR-Flash语音识别模型支持三十种语言和十六种方言,准确率达到87.8%。该模型通过上下文和热词减少语义歧义,提升了对方言和小语种的识别能力,适用于复杂业务场景。
会话式AI利用大语言模型和语音识别技术实现自然对话。预计到2028年,60%的消费者应用将内置此技术。即构科技的ZEGO AI Agent深度整合实时音视频网络,提供低延迟的语音互动,核心技术包括语音识别、语言模型和检索增强生成,确保对话流畅准确。
AI语音开发是构建实时语音交互系统的过程,涉及语音识别、语言模型和语音合成等技术。核心链路包括用户语音输入、ASR识别、LLM理解与生成、TTS合成和实时传输。开发的难点在于降低端到端延迟,确保对话流畅。可选择全自研或使用一体化平台,以适应不同场景需求。评估方案时需关注延迟、准确率、灵活性和成本等维度。
AI实时语音技术通过语音识别、语义理解、语音合成和实时传输实现自然对话,核心在于毫秒级响应。与传统技术相比,AI实时语音不仅理解字面意思,还能捕捉情绪,提升交流质量。未来,随着技术进步,AI语音系统将更加人性化,但仍需长期投入和精细化开发。
AI陪聊软件利用语音识别、语义理解、记忆管理和实时互动技术,为用户提供情感支持和陪伴,适合情绪倾诉和兴趣交流等场景。但在医疗、法律等高风险领域需谨慎使用。未来,随着技术进步,AI的理解能力将提升,但真正的陪伴感仍需长期投入与打磨。
AI对话开发结合语音识别、大语言模型和语音合成,能够与用户自然交流,广泛应用于智能客服、AI陪伴和在线教育等领域。与传统聊天机器人不同,AI对话能够理解上下文和处理开放式问题。核心技术包括ASR、LLM、TTS和RTC,语音对话对延迟要求更高。建议从智能客服入手,采用一体化方案以降低工程复杂度。
苹果在年度无障碍功能更新中推出多项新功能,包括为未配字幕视频提供语音识别、增强VoiceOver的图像描述和自然语言导航。此外,Vision Pro将支持与电动轮椅系统连接,以减少乘车时的晕动症。
完成下面两步后,将自动完成登录并继续当前操作。