➡️
继续阅读
-
如何凭空参加行业大会,观看大佬分享?AI帮你打开思维,轻松理解每一个最新前沿知识
作者利用抖音官方推荐系统资料,通过免费AI工具制作行业大会风格的录播视频,零成本分享知识。他反思AI时代博客价值,认为“活人感”稀缺,决定继续写作但减少说...
-
AI 智创简报:《说话人分离专利转向流式,转写接单者的工具活》
近一年,NVIDIA与Google公开了四项说话人分离专利,推动该技术从离线批处理转向流式处理,并引入大模型纠错。此技术旨在解决转写中“谁在何时说话”的难...
-
写给 Python 工程师的 OpenClaw.NET 上手指南:用你熟悉的 Python 思维,跑起一个生产级 AI Agent - 张善友
OpenClaw.NET 是一个用 .NET 编写的开源 AI Agent 运行时,内置鉴权、记忆、多渠道接入等功能,可编译为无依赖的单文件二进制。文章面...
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前...
-
EP224:MCP与RAG及AI代理的对比
本文介绍MCP、RAG与AI Agent的区别:MCP是连接AI与外部工具的标准协议;RAG通过检索外部数据提供最新答案;AI Agent能自主决策执行任...
-
Kimi K3 模型结构(5):宽度维度,Stable LatentMoE
Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSN...