➡️
继续阅读
-
AI 智创简报:《说话人分离专利转向流式,转写接单者的工具活》
近一年,NVIDIA与Google公开了四项说话人分离专利,推动该技术从离线批处理转向流式处理,并引入大模型纠错。此技术旨在解决转写中“谁在何时说话”的难...
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前...
-
Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合
本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至5...
-
内容创作者失误
During Naomi Osaka's match against Anastasia Zakharova at this year's...
-
Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减
本文介绍Kimi K3模型序列维度的chunkwise并行算法:将序列分块,块间递推状态、块内用矩阵乘并行计算。K3将每步log-decay加−5下界,使...
-
如何凭空参加行业大会,观看大佬分享?AI帮你打开思维,轻松理解每一个最新前沿知识
故事的开始是这样的,我前两天,看到抖音官方发布了它们的推荐系统的分享内容,这份来自官方的资料,值得每一个研究抖音的朋友学习。但是,这份内容的文字比较多,而...