小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
神州泰岳ava 2.0数字员工矩阵亮相上海WAIC

神州泰岳在上海WAIC展示了ava 2.0数字员工矩阵,包括企业协作平台ava me+、语音数字员工avavox和个人助手ava app。ava me+帮助企业组建数字员工团队,avavox整合语音识别与大模型能力,ava app具备长期记忆,记录用户偏好与目标。这三款产品覆盖企业、客户服务与个人助理场景。

神州泰岳ava 2.0数字员工矩阵亮相上海WAIC

全球TMT-美通国际
全球TMT-美通国际 · 2026-07-17T11:29:16Z
NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型

NVIDIA 发布了 Audex,这是一个统一的音频-文本大型语言模型,具备理解和生成音频及语音的能力,同时保持文本智能。Audex 采用 30 亿参数的 MoE 结构,设计简洁,避免了多模态模型的性能退化,在文本和音频任务中表现优异,尤其在语音识别领域领先。尽管存在商业许可限制和音频理解能力不足等缺点,Audex 仍在多项任务中表现出色。

NVIDIA 发布 Audex (Nemotron-Labs-Audex-30B-A3B):一种统一的音频-文本大语言模型

实时互动网
实时互动网 · 2026-07-08T02:20:40Z
语音是物理 AI 的关键,开发方法需要跟上

在物理 AI 的发展中,语音识别成为关键能力,机器需要理解语音指令、区分说话者并过滤噪音。远场语音识别在复杂环境中面临挑战,基于物理的声学建模可以提升语音识别性能。FFASR 排行榜为评估语音模型在真实条件下的表现提供了新方法,帮助开发者确保产品的可靠性和易用性。

语音是物理 AI 的关键,开发方法需要跟上

实时互动网
实时互动网 · 2026-07-07T03:24:02Z
Voicebox免费开源AI语音克隆 | 本地替代 ElevenLabs

Voicebox是一款开源的本地AI语音工具,具备语音克隆、文本转语音和语音识别功能。用户只需录制几秒钟的声音,即可生成多种语言的语音,且无需云端支持和费用。它支持多种语音引擎,适合制作有声书和播客,保护用户隐私,是传统付费服务的替代品。

Voicebox免费开源AI语音克隆 | 本地替代 ElevenLabs

极道
极道 · 2026-06-29T11:06:00Z
模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

阿里推出的Fun-ASR-Flash语音识别模型支持三十种语言和十六种方言,准确率达到87.8%。该模型通过上下文和热词减少语义歧义,提升了对方言和小语种的识别能力,适用于复杂业务场景。

模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

实时互动网
实时互动网 · 2026-06-29T09:34:57Z
什么是会话式 AI?聊天机器人的核心技术拆解

会话式AI利用大语言模型和语音识别技术实现自然对话。预计到2028年,60%的消费者应用将内置此技术。即构科技的ZEGO AI Agent深度整合实时音视频网络,提供低延迟的语音互动,核心技术包括语音识别、语言模型和检索增强生成,确保对话流畅准确。

什么是会话式 AI?聊天机器人的核心技术拆解

实时互动网
实时互动网 · 2026-06-29T08:09:20Z
什么是AI语音开发?从技术链路到落地场景的完整拆解

AI语音开发是构建实时语音交互系统的过程,涉及语音识别、语言模型和语音合成等技术。核心链路包括用户语音输入、ASR识别、LLM理解与生成、TTS合成和实时传输。开发的难点在于降低端到端延迟,确保对话流畅。可选择全自研或使用一体化平台,以适应不同场景需求。评估方案时需关注延迟、准确率、灵活性和成本等维度。

什么是AI语音开发?从技术链路到落地场景的完整拆解

实时互动网
实时互动网 · 2026-06-11T06:57:24Z
什么是AI实时语音技术?如何理解AI实时语音技术

AI实时语音技术通过语音识别、语义理解、语音合成和实时传输实现自然对话,核心在于毫秒级响应。与传统技术相比,AI实时语音不仅理解字面意思,还能捕捉情绪,提升交流质量。未来,随着技术进步,AI语音系统将更加人性化,但仍需长期投入和精细化开发。

什么是AI实时语音技术?如何理解AI实时语音技术

实时互动网
实时互动网 · 2026-06-08T08:18:43Z
如何理解AI陪聊软件原理?哪些场景适合AI陪聊软件

AI陪聊软件利用语音识别、语义理解、记忆管理和实时互动技术,为用户提供情感支持和陪伴,适合情绪倾诉和兴趣交流等场景。但在医疗、法律等高风险领域需谨慎使用。未来,随着技术进步,AI的理解能力将提升,但真正的陪伴感仍需长期投入与打磨。

如何理解AI陪聊软件原理?哪些场景适合AI陪聊软件

实时互动网
实时互动网 · 2026-06-08T07:40:14Z
什么是 AI 对话开发?AI 对话开发有什么用途?(2026 完整指南)

AI对话开发结合语音识别、大语言模型和语音合成,能够与用户自然交流,广泛应用于智能客服、AI陪伴和在线教育等领域。与传统聊天机器人不同,AI对话能够理解上下文和处理开放式问题。核心技术包括ASR、LLM、TTS和RTC,语音对话对延迟要求更高。建议从智能客服入手,采用一体化方案以降低工程复杂度。

什么是 AI 对话开发?AI 对话开发有什么用途?(2026 完整指南)

实时互动网
实时互动网 · 2026-06-04T08:24:17Z
苹果的无障碍功能增加了更多基于人工智能的处理

苹果在年度无障碍功能更新中推出多项新功能,包括为未配字幕视频提供语音识别、增强VoiceOver的图像描述和自然语言导航。此外,Vision Pro将支持与电动轮椅系统连接,以减少乘车时的晕动症。

苹果的无障碍功能增加了更多基于人工智能的处理

The Verge
The Verge · 2026-05-19T14:58:12Z
云知声 U2-ASR 2.5上线:覆盖七大方言体系,支持100种以上方言及地方口音识别转写

云知声推出的U2-ASR 2.5方言语音识别模型支持100种以上方言,识别准确率超过90%。该模型通过优化数据处理、解码和语义理解,将方言转化为规范普通话,广泛应用于政务、医疗和客服等领域。

云知声 U2-ASR 2.5上线:覆盖七大方言体系,支持100种以上方言及地方口音识别转写

实时互动网
实时互动网 · 2026-05-13T03:24:32Z
目标说话人识别大模型,让车外语音“聚精会神”听懂你

新一代SU7汽车采用目标说话人识别(TS-ASR)和动态追踪(TS-Tracking)技术,有效解决车外语音识别中的干扰问题。该系统能够在嘈杂环境中精准识别用户指令,提升交互体验。通过声纹注册,用户可在移动中下达指令,系统能有效过滤其他声音,实现更智能的语音交互。

目标说话人识别大模型,让车外语音“聚精会神”听懂你

小米云技术
小米云技术 · 2026-05-06T09:00:54Z
Canonical为Ubuntu Linux制定AI计划

Canonical计划在2026年前为Ubuntu Linux添加AI功能,包括改进的语音识别和个人自动化工具,以提升操作系统的功能和用户体验。尽管鼓励工程师使用AI,但Canonical强调Ubuntu不会成为AI产品,也不会将AI作为评估标准。

Canonical为Ubuntu Linux制定AI计划

The Verge
The Verge · 2026-04-27T20:47:45Z
参加全国大学生智能汽车竞赛需要的CSK5062离线语音控制资源上手指引

第21届全国智能汽车竞赛中,参赛者需使用CSK5062芯片控制电子红绿灯的语音识别和LED显示。文章介绍了芯片特性、SDK获取、开发流程及示例,支持离线语音识别和自定义命令词,开发者可通过官方文档获取详细指导。

参加全国大学生智能汽车竞赛需要的CSK5062离线语音控制资源上手指引

分享AI芯片开发经验
分享AI芯片开发经验 · 2026-04-24T10:30:56Z
MiMo-V2.5-TTS-Series + ASR 正式发布

MiMo-V2.5系列语音模型实现了从简单听读到精准理解与灵活表达的转变,支持语音识别与合成,能够在复杂场景中高效交互。该模型根据自然语言指令生成多样音色,提升语音表达的情感与细腻度,尤其在多种语言和噪音环境中表现优异,确保准确转写,推动语音技术的发展。

MiMo-V2.5-TTS-Series + ASR 正式发布

小米云技术
小米云技术 · 2026-04-23T18:01:46Z
Adobe 和 Speechmatics 为 Premiere 提供“云级”的设备端语音识别功能

Adobe 扩大与 Speechmatics 的合作,为 Premiere 提供本地语音识别功能,确保高精度转录并保护隐私。新模型在设备端实现接近云端的准确度,处理速度快,适用于各种硬件,满足安全和隐私需求,支持不同环境中的无缝工作。

Adobe 和 Speechmatics 为 Premiere 提供“云级”的设备端语音识别功能

实时互动网
实时互动网 · 2026-04-22T03:35:11Z

HagiCode项目通过语音识别和图片上传功能,提升了用户与AI助手的交互体验,用户可通过语音或截图解决问题,避免打字。尽管遇到WebSocket不支持自定义header的问题,但最终通过后端代理方案解决了安全性和兼容性问题。

打字不如说话,说话不如截图——AI 代码助手的多模态输入实践

dotNET跨平台
dotNET跨平台 · 2026-03-31T23:57:29Z
谷歌发布 Gemini 3.1 Flash Live:面向AI代理的实时多模态语音模型

谷歌发布了Gemini 3.1 Flash Live预览版,旨在实现低延迟的实时语音交互。该模型通过原生音频处理提升了嘈杂环境中的语音识别准确性,并支持双向流式传输,允许用户中断对话。同时,开发者可调整推理深度,以优化速度与准确性。

谷歌发布 Gemini 3.1 Flash Live:面向AI代理的实时多模态语音模型

实时互动网
实时互动网 · 2026-03-27T03:15:06Z
使用Hugging Face部署AI模型

Hugging Face已成为现代AI革命的核心平台。freeCodeCamp.org YouTube频道推出了一门新课程,教授如何在该平台上部署AI模型,内容涵盖Transformer库、语音识别和生成AI等,适合各级别学习者。

使用Hugging Face部署AI模型

freeCodeCamp.org
freeCodeCamp.org · 2026-03-25T20:18:56Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码