小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”

本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前景说话人转录,强调数据构造需明确时间、能量、空间关系,模型应学会选择交互主体而非单纯降噪,推动ASR从内容识别走向场景理解。

Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”

实时互动网 实时互动网 · 2026-09-04T02:43:33Z
技术漫谈|ASR中的瑞士军刀:方言识别

方言语音识别不仅需听清发音,还需决定如何书写。难点分三层:声音、词汇语法和书写。大模型能提升能力,但需区分忠实转写与方言转普通话两种任务,并处理文本正则化、热词增强和口语顺滑。系统应分层建模,分别评价,以尊重方言原貌并满足不同场景需求。

技术漫谈|ASR中的瑞士军刀:方言识别

实时互动网 实时互动网 · 2026-09-01T07:21:59Z
ZEGO 实时互动 AI Agent 2.14.0 发布:新增 Microsoft ASR 供应商等功能

ZEGO实时互动AI Agent 2.14.0版本发布,新增Microsoft ASR供应商、获取AI语音播报文本内容PlayedText、对讲机模式与聆听模式支持取消聆听,以及基于Server Secret加密APIKey等功能。

ZEGO 实时互动 AI Agent 2.14.0 发布:新增 Microsoft ASR 供应商等功能

实时互动网 实时互动网 · 2026-08-25T06:27:34Z
S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本

Superwhisper发布S1系列,其中S1-mini为开源0.6B文本规范化模型,基于Qwen3微调,将ASR转录转为整洁文本,支持风格、结构、上下文三轴控制。Q4量化仅462MB,可本地部署。需关闭思考模式并贪心解码,测试token准确率94.8%。云端S1-Voice和S1-Language提供转录与格式化服务。

S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本

实时互动网 实时互动网 · 2026-08-21T02:50:45Z
会议 ASR 的下一站:让大模型自己学会听懂会议

会议ASR大模型需直接处理真实会议中的远场、混响、噪声、重叠说话及术语等复杂情况,而非依赖外部前端。模型应内生声学鲁棒性、多说话人结构、长上下文理解和克制生成能力,输出含说话人、时间戳的结构化记录,以支撑摘要、问答等上层应用,减少误差传播。

会议 ASR 的下一站:让大模型自己学会听懂会议

实时互动网 实时互动网 · 2026-08-21T02:30:24Z
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

腾讯发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度识别与语义理解,在通用识别、方言、上下文感知等维度提升。在开源和自建评测中WER领先,中文普通话3.34%、英语2.62%、粤语3.12%。已上线腾讯云API,元宝App免费体验。

腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

量子位 量子位 · 2026-08-04T08:58:21Z
腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview,基于Hy3大模型提升通用识别、方言覆盖、上下文理解及复杂环境鲁棒性,在开源和自建评测中WER表现领先。支持热词注入,适配专业场景,已上线腾讯云API,并集成于元宝App,免费提供语音输入服务。

腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

实时互动网 实时互动网 · 2026-08-04T08:34:58Z
阿里发布 Fun-ASR-Realtime 实时语音识别模型 ,支持16种方言和30种语言!

阿里通义推出了实时语音识别模型Fun-ASR-Realtime,具备百毫秒首字延迟和高准确率,支持16种方言和30种语言。在“重返荒岛”直播中,该模型提供实时字幕,识别准确率接近离线模型,适用于国际会议和客服等复杂场景。

阿里发布 Fun-ASR-Realtime 实时语音识别模型 ,支持16种方言和30种语言!

实时互动网 实时互动网 · 2026-07-06T08:48:44Z
模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

阿里推出的Fun-ASR-Flash语音识别模型支持三十种语言和十六种方言,准确率达到87.8%。该模型通过上下文和热词减少语义歧义,提升了对方言和小语种的识别能力,适用于复杂业务场景。

模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

实时互动网 实时互动网 · 2026-06-29T09:34:57Z
如何使用 NVIDIA Canary-1B-v2 在 Python 中实现 ASR、翻译和自动 SRT 字幕导出

本文介绍了如何使用NVIDIA Canary-1B-v2构建多语言自动语音识别(ASR)和翻译工作流程,包括安装依赖项、加载模型、处理音频、执行英语转录和多语言翻译、生成时间戳及导出SRT字幕,最后测试长文本转录和批量处理以评估模型性能。

如何使用 NVIDIA Canary-1B-v2 在 Python 中实现 ASR、翻译和自动 SRT 字幕导出

实时互动网 实时互动网 · 2026-06-24T02:20:25Z
AI 语音聊天机器人背后是怎么实现的,是 ASR + LLM + TTS 串起来吗,延迟怎么压下去

AI语音聊天机器人的实现依赖多个模块的协同,关键在于整体架构、流式串联、并行与预测、传输与端侧优化。通过优化各环节,端到端延迟可降低至700~900毫秒,接近真人对话速度。团队应明确延迟目标,利用成熟技术平台降低工程门槛,专注于对话逻辑创新。未来,随着技术进步,延迟有望进一步降低。

AI 语音聊天机器人背后是怎么实现的,是 ASR + LLM + TTS 串起来吗,延迟怎么压下去

实时互动网 实时互动网 · 2026-06-12T07:33:39Z
如何训练AI语音开发模型?从数据准备到三层优化的实操路径

训练AI语音模型的关键在于优化而非从头训练。训练分为三层:ASR领域适配、LLM场景优化和TTS音色优化。ASR通过热词定制和选择合适模型提升准确率;LLM可通过提示工程、RAG和微调进行优化;TTS需选择合适音色和情感配置。建议先进行轻量优化,再考虑重型训练,以提高效率和效果。

如何训练AI语音开发模型?从数据准备到三层优化的实操路径

实时互动网 实时互动网 · 2026-06-11T07:18:17Z
哪些AI语音开发平台收费低?了解最省钱的选型组合

选择AI语音平台时需考虑四层成本:ASR识别费、LLM推理费、TTS合成费和RTC传输费。不同场景下最佳组合不同。通过选择合适模型、利用免费额度、优化TTS合成和精简上下文等方式可降低费用。综合考虑各项成本,才能找到真正的低收费方案。

哪些AI语音开发平台收费低?了解最省钱的选型组合

实时互动网 实时互动网 · 2026-06-11T07:05:48Z
NVIDIA 发布 Nemotron 3.5 ASR:一个拥有 6 亿参数、支持缓存的流式转录模型,可实时转录 40 种语言区域设置

NVIDIA发布了Nemotron 3.5 ASR,这是一个支持40种语言的流式自动语音识别模型,拥有6亿参数。该模型采用FastConformer-RNNT架构,实时转录时无需单独处理标点和大小写,推理延迟可调,适合多种应用场景。经过微调,希腊语和保加利亚语的识别准确率显著提高。

NVIDIA 发布 Nemotron 3.5 ASR:一个拥有 6 亿参数、支持缓存的流式转录模型,可实时转录 40 种语言区域设置

实时互动网 实时互动网 · 2026-06-08T02:31:38Z
ZEGO 实时互动 AI Agent 2.12 版本发布,新增多家 ASR 厂商和模型等功能

2026年5月12日,ZEGO发布实时互动AI Agent 2.12版本,新增多家ASR厂商和模型,支持中文方言及多语种识别,并引入新加坡节点以降低延迟,满足海外客户需求。同时,新增Round机制,便于追踪对话链路,适用于AI陪聊和智能客服等场景。

ZEGO 实时互动 AI Agent 2.12 版本发布,新增多家 ASR 厂商和模型等功能

实时互动网 实时互动网 · 2026-05-13T06:30:56Z
云知声 U2-ASR 2.5上线:覆盖七大方言体系,支持100种以上方言及地方口音识别转写

云知声推出的U2-ASR 2.5方言语音识别模型支持100种以上方言,识别准确率超过90%。该模型通过优化数据处理、解码和语义理解,将方言转化为规范普通话,广泛应用于政务、医疗和客服等领域。

云知声 U2-ASR 2.5上线:覆盖七大方言体系,支持100种以上方言及地方口音识别转写

实时互动网 实时互动网 · 2026-05-13T03:24:32Z
MiMo-V2.5-TTS-Series + ASR 正式发布

MiMo-V2.5系列语音模型实现了从简单听读到精准理解与灵活表达的转变,支持语音识别与合成,能够在复杂场景中高效交互。该模型根据自然语言指令生成多样音色,提升语音表达的情感与细腻度,尤其在多种语言和噪音环境中表现优异,确保准确转写,推动语音技术的发展。

MiMo-V2.5-TTS-Series + ASR 正式发布

小米云技术 小米云技术 · 2026-04-23T18:01:46Z
低延迟、多语种、轻量化,Voxtral Realtime 打破 ASR 全场景桎梏;可穿戴设备设计福音!Antenna Performance 构建天线性能与故障数据集

Mistral AI于2026年2月开源了Voxtral Mini 4B Realtime 2602模型,支持13种语言的实时语音转录,延迟低于500毫秒,适合轻量化应用,并可在边缘计算单元上部署,提升语音识别的精度与效率。

低延迟、多语种、轻量化,Voxtral Realtime 打破 ASR 全场景桎梏;可穿戴设备设计福音!Antenna Performance 构建天线性能与故障数据集

HyperAI超神经 HyperAI超神经 · 2026-03-13T08:23:29Z

阿里开源的Qwen3-ASR语音识别模型支持52种语言,能快速准确识别饶舌歌曲,处理5小时音频仅需10秒,适合AI硬件部署,开发者可免费下载使用。

千问语音识别模型Qwen3-ASR开源!饶舌RAP歌曲也能轻松识别

量子位 量子位 · 2026-01-30T02:48:17Z
微软发布 VibeVoice-ASR:一种统一的语音转文本模型,旨在一次性处理长达 60 分钟的音频

微软推出了VibeVoice-ASR,一个开源的语音转文本模型,支持最长60分钟的音频处理,输出结构化文本,包括“谁”、“何时”、“什么”。该模型允许用户自定义热词,以提高识别准确性,适合会议记录和长时间通话。

微软发布 VibeVoice-ASR:一种统一的语音转文本模型,旨在一次性处理长达 60 分钟的音频

实时互动网 实时互动网 · 2026-01-23T02:19:22Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码