➡️
继续阅读
-
AI 智创简报:《说话人分离专利转向流式,转写接单者的工具活》
近一年,NVIDIA与Google公开了四项说话人分离专利,推动该技术从离线批处理转向流式处理,并引入大模型纠错。此技术旨在解决转写中“谁在何时说话”的难...
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前...
-
Minmax H3中英提示词效果差异测试 - 蝈蝈俊
对于MiniMax H3,使用中文和英文提示词时,能看到都在说,英文提示词通常能带来更好的生成效果。但是我实际测试下来,感觉差别不大。 我的测试是基于北京...
-
OpenAI admits to German wiki ‘incident’
OpenAI says it needs to overhaul how and when it reports instances of AI mode...
-
Robotaxis enter their villain era
It's Bullitt meets Christine meets Waymo. A new short film imagines a San...
-
Beyond Zero: Google Publishes Successor to BeyondCorp
In a recent research paper, Google introduced Beyond Zero, a “security model ...