➡️
继续阅读
-
AI 智创简报:《说话人分离专利转向流式,转写接单者的工具活》
近一年,NVIDIA与Google公开了四项说话人分离专利,推动该技术从离线批处理转向流式处理,并引入大模型纠错。此技术旨在解决转写中“谁在何时说话”的难...
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前...
-
特斯拉Cybercab正式在美投入运营,9月或来北京上海展出
特斯拉Cybercab无人驾驶出租车在美国得克萨斯州奥斯汀正式投入运营,这是全球首款专为无人驾驶设计的量产车型,取消了方向盘和踏板,由FSD系统控制,续航...
-
Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减
本文介绍Kimi K3模型序列维度的chunkwise并行算法:将序列分块,块间递推状态、块内用矩阵乘并行计算。K3将每步log-decay加−5下界,使...
-
谎言秩序:俄罗斯公共生活的荒诞性
俄罗斯公共生活长期依赖谎言维系,导致民众集体心理扭曲。普京以荒诞谎言解释普利戈任之死,意在展示权力并寻求民众配合。俄罗斯人表面接受谎言,形成犬儒主义常态,...
-
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA
本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进...