➡️
继续阅读
-
将GPU推理冷启动从8分钟缩短至不到1分钟
本文分析了GPU节点上大语言模型冷启动的瓶颈,发现从Pod创建到首次推理响应需8分钟,涉及六个阶段。主要问题包括CUDA内核重复编译(小模型占65%时间)...
-
美团智播:数字人直播技术创新与实践
一场 7×24 小时不间断的直播,对真人主播团队意味着高昂人力成本,对百万中小商家更是一道难以迈过的门槛;而“一眼假”的数字人——面部僵硬、动作循环、手势...
-
谷歌在 Gmail、Docs 和 Keep 中推出 AI 语音功能
谷歌在Docs、Gmail和Keep中推出对话式AI功能,用户可用自然语言提问或语音输入完成任务。Gmail Live可查询收件箱,Docs Live辅助...
-
Witbe 推出用于视频测试自动化的 AI 模型
Witbe推出自研视觉语言模型Witbe VLMs,用于视频测试自动化,与通用模型协同工作。该模型针对机顶盒等特定场景训练,性能不逊于前沿模型,且延迟更低...
-
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前...
-
GPT-6不再收取超过272K部分超额费用 开发者可以在Codex里直接启用1M窗口
OpenAI调整GPT-6 Astra在Codex中的计费政策:使用该模型时,1M上下文窗口内超出272K部分不再额外收费,全部按标准费率计费,且缓存输入...