➡️
继续阅读
-
AI 智创简报:《说话人分离专利转向流式,转写接单者的工具活》
近一年,NVIDIA与Google公开了四项说话人分离专利,推动该技术从离线批处理转向流式处理,并引入大模型纠错。此技术旨在解决转写中“谁在何时说话”的难...
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前...
-
Kimi K3 模型结构(4):深度维度,Attention Residuals
本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对e...
-
Kimi K3 模型结构(0):一张图看懂 Kimi K3
Kimi K3是2.78T参数、104.2B激活的93层MoE模型,支持1M上下文及图像视频输入。其结构创新分三方面:序列用KDA与Gated MLA混合...
-
入蜀记 day467 小小的真理
「小小的真理。」
-
入蜀记 day466 近谿
作者在2026年9月的日记中记录了梦境中与老同学重逢的喜悦,反思了苏轼等古人思想被忽视的现象,分享了使用AI工具优化工作流程的体验,并强调了真实生活不可被...