➡️
继续阅读
-
AI 智创简报:《说话人分离专利转向流式,转写接单者的工具活》
近一年,NVIDIA与Google公开了四项说话人分离专利,推动该技术从离线批处理转向流式处理,并引入大模型纠错。此技术旨在解决转写中“谁在何时说话”的难...
-
“我1%的工程师消耗了40%的token”:Coder与SpaceXAI为何要给开发者提供更好的工具
Coder推出Agent Relay服务,与SpaceXAI合作,使软件团队能在自有基础设施上运行编码代理,而Cursor负责云端推理。该方案针对银行、国...
-
dsh-speech测评:DeepSeek Harness语音插件让打字变成历史
dsh-speech是DeepSeek Harness的语音插件,支持实时语音输入和AI回答的语音摘要,由AllModels.io提供技术。它区别于其他插...
-
谷歌在 Gmail、Docs 和 Keep 中推出 AI 语音功能
谷歌在Docs、Gmail和Keep中推出对话式AI功能,用户可用自然语言提问或语音输入完成任务。Gmail Live可查询收件箱,Docs Live辅助...
-
Witbe 推出用于视频测试自动化的 AI 模型
Witbe推出自研视觉语言模型Witbe VLMs,用于视频测试自动化,与通用模型协同工作。该模型针对机顶盒等特定场景训练,性能不逊于前沿模型,且延迟更低...
-
Kimi K3 模型结构(0):一张图看懂 Kimi K3
Kimi K3是2.78T参数、104.2B激活的93层MoE模型,支持1M上下文及图像视频输入。其结构创新分三方面:序列用KDA与Gated MLA混合...