Moshi是一款实时口头对话系统,具有连贯且上下文准确的语音生成功能,延迟仅为160毫秒。它能够处理重叠语音和中断,语音质量好且易懂。Moshi能够维持长时间对话,上下文跨度超过五分钟,并在口头问答任务中表现出色。它代表了口头对话系统的重大飞跃,树立了新标准。
法国创业团队Kyutai发布了开源实时音频模型Moshi,包括Moshiko、Moshika和Mimi流语音编解码器。Moshi在MacBook上运行,延迟约200毫秒,使用了Mimi流式神经音频编解码器和RQ-Transformer变体架构。Moshi在质量、音频语言建模和口语问答方面表现优秀。OpenAI的高级语音模式可能在9月24日发布。
苹果任命菲尔·席勒为OpenAI董事会观察员,以整合ChatGPT到其设备中。OpenAI的ChatGPT macOS应用更新加密对话以保护用户隐私。Kyutai开源了Moshi,一个实时本地多模态人工智能模型。
在第173期播客中,讨论了最新的人工智能进展,包括谷歌的Gemini 1.5、Meta的LLaMA 3和Runway的Gen 3 Alpha视频模型。此外,还探讨了数据使用的法律争议、中国在AI领域的竞争、美国对AI芯片的出口管制以及Bridgewater的新AI驱动金融基金等话题。
法国人工智能实验室Kyutai推出开源GPT-4竞争对手moshi;黑客窃取了OpenAI的技术信息;日本引进巨型人形机器人维护火车线路;欧洲成立2.2亿美元风险投资基金Forestay专注于人工智能;肯尼亚政府对使用人工智能的风险表示担忧;科学家创造了基因电路将癌细胞自我毁灭并杀死耐药癌细胞。
完成下面两步后,将自动完成登录并继续当前操作。