小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
使用API中的GPT‑Live‑1构建更自然的语音体验

OpenAI在API推出GPT-Live-1语音模型,支持同时听说,简化语音代理架构并降低延迟。该模型具备打断处理、推理与工具调用委托、语气节奏定制、静音与背景噪音管理、长会话可靠性及电话支持。全双工基准性能提升30个百分点,客户反馈代码减少80%,定价为每分钟0.05美元。

使用API中的GPT‑Live‑1构建更自然的语音体验

OpenAI OpenAI · 2026-09-10T00:00:00Z
Wispr Flow 融资 2.8 亿美元并推出语音 AI 模型

Wispr AI完成2.8亿美元B轮融资,估值达20亿美元,并推出自研语音模型Canto。该模型能在嘈杂环境中识别语音,将错误率从30%降至5-10%。其产品Flow已处理超600亿字,被财富500强企业广泛使用,惠及商务人士及听障群体。

Wispr Flow 融资 2.8 亿美元并推出语音 AI 模型

实时互动网 实时互动网 · 2026-08-18T02:38:58Z
NVIDIA 发布 NemotronLabs VoiceChat 11B:一款开放式全双工语音对语音模型

NVIDIA发布开源11B端到端语音模型NemotronLabs VoiceChat 11B,支持实时全双工对话,延迟仅448毫秒,可插话和调用工具。需80GB GPU,仅供研究,未用于生产。在基准测试中表现优异,但存在音频时长限制和语音降级等问题。

NVIDIA 发布 NemotronLabs VoiceChat 11B:一款开放式全双工语音对语音模型

实时互动网 实时互动网 · 2026-08-10T02:30:38Z
Grok Voice Think Fast 2.0 现已在 AI Gateway 上推出

xAI推出Grok Voice Think Fast 2.0语音模型,支持语音输入输出,推理与说话并行,减少延迟,提升转录准确性和对话能力。通过AI Gateway实时API使用,需在服务器端生成短期令牌以保护API密钥,并可在playground试用。

Grok Voice Think Fast 2.0 现已在 AI Gateway 上推出

Vercel News Vercel News · 2026-07-29T00:00:00Z
ChatGPT升级的语音模式更擅长保持安静

OpenAI推出了新的GPT-Live-1语音模型,能够实时说话和倾听,减少打断。该模型支持实时翻译和AI生成的视觉信息,具备内置安全措施,确保适龄回答。GPT-Live-1将在iOS、Android和网页上推出,Go、Plus和Pro用户将使用此模型,免费用户则使用更小的GPT-Live-1迷你版。

ChatGPT升级的语音模式更擅长保持安静

The Verge The Verge · 2026-07-08T17:00:00Z
推出GPT-Live

GPT‑Live是新一代语音模型,支持双向交流,使与AI的对话更自然。它使用GPT‑5.5进行复杂任务处理,提供更智能的回答,并推出了两种版本,以提升人机互动体验和安全性。

推出GPT-Live

OpenAI OpenAI · 2026-07-08T00:00:00Z
OpenAI将GPT-5级推理引入其语音模型

OpenAI推出了三种新的语音模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper。GPT-Realtime-2性能提升11%,支持更复杂的交互;GPT-Realtime-Translate专注于实时翻译,支持70种输入语言和13种输出语言;GPT-Realtime-Whisper是最新的流媒体转录模型,适用于多种语音AI应用场景,定价合理。

OpenAI将GPT-5级推理引入其语音模型

The New Stack The New Stack · 2026-05-07T17:13:46Z
xAI 发布 grok-voice-think-fast-1.0:τ-voice 基准测试成绩高达 67.3%,超越 Gemini、GPT Realtime 等

xAI的新语音模型grok-voice-think-fast-1.0在τ-voice基准测试中以67.3%的得分领先,支持实时推理,能够无延迟处理复杂对话中的语音输入,准确捕获结构化数据。该模型已成功应用于Starlink的客户支持,展现出高效的销售转化率和自动解决客户咨询的能力。

xAI 发布 grok-voice-think-fast-1.0:τ-voice 基准测试成绩高达 67.3%,超越 Gemini、GPT Realtime 等

实时互动网 实时互动网 · 2026-04-27T02:47:21Z
国产免费2B开源语音模型征服《莽撞人》!复刻郭德纲最难贯口

国产开源语音模型VoxCPM 2成功复刻郭德纲的《莽撞人》,展现高保真、多方言和多语种能力,音质达到CD级别,适用于游戏和影视等领域,吸引了众多用户体验。

国产免费2B开源语音模型征服《莽撞人》!复刻郭德纲最难贯口

量子位 量子位 · 2026-04-08T06:10:06Z
ICASSP 2026|迈向构建低资源语种的多任务语音理解模型

本文提出了一种针对低资源语言(如泰语)的语音大语言模型(SLLM)多任务理解方案,核心创新包括自监督学习的语音编码器XLSR-Thai、通用语音-文本对齐方法U-Align,以及泰语口语理解数据生成流水线Thai-SUP。实验结果表明,该方案有效提升了泰语的自动语音识别和多任务理解能力,为低资源语言的SLLMs构建提供了新路径。

ICASSP 2026|迈向构建低资源语种的多任务语音理解模型

实时互动网 实时互动网 · 2026-03-19T03:07:54Z
针对哪种模型的评估?语音模型评估的分类法

本文提出了一种统一的分类法,用于评估语音模型,解决不同模型在语音处理中的评估需求。该分类法定义了三个维度:评估方面、模型能力和任务要求。通过将现有评估与模型能力和方法论需求相匹配,提供了选择和解释语音模型评估的框架,并揭示了未来基准设计的优先领域。

针对哪种模型的评估?语音模型评估的分类法

Apple Machine Learning Research Apple Machine Learning Research · 2026-01-09T00:00:00Z
更流畅对话、更多语言支持!Nova 2 Sonic让构建语音应用更轻松

亚马逊云科技推出的Amazon Nova 2 Sonic语音模型提升了语音交互的流畅性与智能性,支持多语言切换,优化了语音识别和对话机制,增强了多任务处理能力,适用于多种应用场景。

更流畅对话、更多语言支持!Nova 2 Sonic让构建语音应用更轻松

实时互动网 实时互动网 · 2026-01-06T03:41:49Z
美团开源LongCat-Audio-Codec,高效语音编解码器助力实时交互落地

美团LongCat团队开源了LongCat-Audio-Codec,解决了语音大语言模型在Token化中的难题。该方案通过双Token并行提取、低延迟解码和超低比特率高保真设计,实现了高效音频处理,提升了语音理解与生成质量,降低了技术门槛,丰富了应用场景,推动了语音智能系统的发展。

美团开源LongCat-Audio-Codec,高效语音编解码器助力实时交互落地

美团技术团队 美团技术团队 · 2025-11-14T00:00:00Z
刚刚,豆包连发多款大模型:让 DeepSeek更好用,音频版 Sora 惊艳全场

豆包大模型推出四档思考长度调节功能,提高AI使用效率并降低企业成本。同时,新语音模型能准确朗读复杂公式,增强语音交互能力。火山引擎发布智能模型路由,自动选择最优模型以满足不同需求,推动AI行业发展。

刚刚,豆包连发多款大模型:让 DeepSeek更好用,音频版 Sora 惊艳全场

爱范儿 爱范儿 · 2025-10-16T09:36:48Z
中科院发布可扩展模块化语音语言模型 LLaMA-Omni2,以最小的延迟进行实时对话

中国科学院计算技术研究所推出的LLaMA-Omni2是一个支持语音的大型语言模型,结合语音感知与语言理解,实现实时口语对话。该模型采用端到端流水线,训练成本低且具有模块化可解释性。在200K语音对话样本上训练后,LLaMA-Omni2的表现优于基线模型,证明高质量、低延迟的语音交互无需大量语料库。

中科院发布可扩展模块化语音语言模型 LLaMA-Omni2,以最小的延迟进行实时对话

实时互动网 实时互动网 · 2025-05-07T02:28:07Z

本研究提出VITA-Audio,一种高效的大规模语音模型,解决了现有模型在流媒体生成首个音频令牌时的高延迟问题。通过引入轻量级的多模态交叉令牌预测模块,该模型显著提高了推理速度,具备实时对话能力,并在多个任务中表现优异。

VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large-Scale Speech Language Models

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-06T00:00:00Z

本研究提出了一种新颖的自适应后训练量化算法StableQuant,显著优化了语音基础模型的量化性能。该算法将模型尺寸缩小至四分之一,并在8位量化下保持字错误率低于0.3%,同时提升推理速度。

StableQuant: Layer-wise Adaptive Post-Training Quantization for Speech Foundation Models

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-21T00:00:00Z

百度推出的端到端语音语言大模型,利用Cross-Attention技术将语音交互成本降低90%,提升响应速度和真实感。该模型结合语音识别与语言模型,解决了传统语音交互的痛点,推动了大模型在语音领域的应用。

语音界Deepseek!百度最新跨模态端到端语音交互,成本最高降90%

量子位 量子位 · 2025-04-02T07:52:28Z
SELMA:用于虚拟助手交互的语音启用语言模型

本文介绍了SELMA,一个用于虚拟助手交互的语音启用语言模型。SELMA同时处理三项主要任务和两项辅助任务,采用低秩适应模块进行高效训练。实验结果表明,SELMA在语音触发检测和设备导向语音检测任务上显著提高了性能,简化了虚拟助手的输入处理流程。

SELMA:用于虚拟助手交互的语音启用语言模型

Apple Machine Learning Research Apple Machine Learning Research · 2025-03-05T00:00:00Z

豆包语音模型升级后,在小说演播中表现优异,CMOS评分超过90%。新技术实现端到端合成,无需标签,提升音质和情感表达,适用于多种有声书,未来将继续探索更优质的听书体验。

AI说书媲美真人!豆包语音大模型升级长上下文理解

量子位 量子位 · 2025-02-26T07:28:01Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码