语音AI的“人味”取决于响应时机而非模型大小,小模型实时处理反而更像真人。“电话兜住率”具误导性,应关注解决率。听起来像人却会编造答案的AI,比机械但基于真实数据的AI更糟。语音智能在于不存储什么,专注小模型可胜过大模型。理想部署应识别能力边界并适时转人工。语音不会取代其他界面,而是增强。简单拼接API算不上语音智能体,规模化需芯片级优化。
JetBrains研究团队提出一种超越“解决率”的编码智能体评估方法,从结果、效率、补丁质量和过程四个维度分析模型轨迹。对比Claude Opus 4.7和Gemini 3.5 Flash发现,两者解决率相近但行为差异显著:Opus诊断强但验证不足,Gemini验证好但易冗余和幻觉。该框架旨在构建模型画像,优化模型选择与智能体设计。
Intercom发布的Fin Apex公告显示其新AI客服模型解决率提升至75%,成本降低。公司强调未来竞争将依赖于专有数据和持续优化的技术,而成功的供应商需具备强大的内部AI能力以实现高效客户服务。
本研究提出SWE-RL方法,将强化学习应用于大型语言模型(LLM)推理,通过基于规则的奖励机制,使LLM从开源软件数据中学习,最终实现41.0%的解决率,展现出优越的推理能力。
完成下面两步后,将自动完成登录并继续当前操作。