➡️
继续阅读
-
OpenAI 将实时全双工语音模型 GPT-Live-1 以 API 的形式发布
OpenAI发布实时全双工语音模型GPT-Live-1的API,开发者可构建响应更快的语音应用。该模型可同时听与说,支持流畅打断,在Tau3语音代理基准测...
-
因计算容量不足 OpenAI暂停ChatGPT Pro 20x开通 现有订阅可以继续使用
OpenAI因计算容量不足,暂停ChatGPT Pro 20x版新用户开通,已订阅用户仍可续用,目前仅能开通每月100美元的5x版。大量用户遇到模型过载提...
-
将字幕付诸测试:通过多项选择问答评估视频字幕质量
研究提出CapQuiz,一种无参考视频字幕评测基准,通过人工验证的多选题考察字幕信息保真度,涵盖10类问题、24个视频领域,并设计CapF1指标综合衡量事...
-
CocktailASR-1 开源:目标说话人识别更像一个工程问题了
小米开源CocktailASR-1,聚焦目标说话人语音识别:指定要识别的说话人后,模型只输出该人内容,而非还原全部声音,更贴近会议、车载、客服等场景。文章...
-
OpenClaw v2026.9.4更新:插件发现和技能学习功能
OpenClaw v2026.9.4发布,包含1558个合并请求。核心更新:插件与技能统一搜索,AI可在聊天中主动推荐;技能工坊通过提案机制让用户审查AI...
-
Firecrawl 如何帮助我们的销售团队打造定制化产品演示
Mux Robots 团队为解决传统功能演示难以打动客户的问题,使用 Firecrawl 抓取客户官网的品牌视觉、业务背景和视频机会,自动生成带有客户品牌...