➡️
继续阅读
-
AI 智创简报:《说话人分离专利转向流式,转写接单者的工具活》
近一年,NVIDIA与Google公开了四项说话人分离专利,推动该技术从离线批处理转向流式处理,并引入大模型纠错。此技术旨在解决转写中“谁在何时说话”的难...
-
蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image
蚂蚁集团开源统一图像生成与编辑模型LLaDA-Image,含6B参数,提供Base和Turbo两版本,支持文生图、编辑及中英文渲染。Turbo采用蒸馏技术...
-
dsh-speech测评:DeepSeek Harness语音插件让打字变成历史
dsh-speech是DeepSeek Harness的语音插件,支持实时语音输入和AI回答的语音摘要,由AllModels.io提供技术。它区别于其他插...
-
谷歌在 Gmail、Docs 和 Keep 中推出 AI 语音功能
谷歌在Docs、Gmail和Keep中推出对话式AI功能,用户可用自然语言提问或语音输入完成任务。Gmail Live可查询收件箱,Docs Live辅助...
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前...
-
李开复彭博社专访:中国AI以“六个月差距”挑战美国,开源模型将赢得全球覆盖战
【TechWeb】9月5日消息,“如果让你花5万美元买一辆新款特斯拉,还是花1.5万美元买一辆性能接近六个月前车型的二手车,答案很明显。”这是零一万物创始...