➡️
继续阅读
-
语音AI开始边听边说,改变的不只是响应速度
OpenAI于9月10日将GPT-Live-1接入API,核心是全双工语音,模型可边听边说并处理打断、停顿与抢话。深度推理和工具调用由后端文本模型负责,前...
-
CocktailASR-1 开源:目标说话人识别更像一个工程问题了
小米开源CocktailASR-1,聚焦目标说话人语音识别:指定要识别的说话人后,模型只输出该人内容,而非还原全部声音,更贴近会议、车载、客服等场景。文章...
-
如何构建自评估AI系统:面向LLM应用的自动化测试与评估流水线
LLM应用输出不确定、无唯一答案且失败隐蔽,传统测试方法失效。文章提出三层评估体系:确定性检查(格式、长度、幻觉链接)、LLM评审(按评分标准打分)、人工...
-
语音AI最大的误区,是默认每个人都在安静房间里说话
语音AI常忽略真实环境噪声。Vaani发布超122小时印度语音数据,含7.2万片段、5.8万说话者、58种语言及10.6万噪声事件,标注毫秒级起止时间,并...
-
用 Rust 构建可组合的 LLM Agent SDK 和终端编码 Agent
rpi 是 Pi agent 的 Rust 原生实现,采用 library-first 理念,将模型 Provider、Agent loop、工具、会话和...
-
特朗普为数据中心污染开绿灯
特朗普政府为加速AI数据中心建设,放松环境监管并削减环保署资源。前环保署官员报告称,自2025年1月以来已有30项联邦行动加剧数据中心污染的健康风险,其中...