小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
GPT-6爆出逆天隐藏能力:只看图片就能还原声音

GPT-6 Astra虽不支持音频输入,却能通过梅尔频谱图图片零样本识别声音,如狗叫和光剑音效。这显示视觉模型能跨感官解读声学模式,突破官方能力边界,引发对AI感官界限和潜在能力的思考。

GPT-6爆出逆天隐藏能力:只看图片就能还原声音

极道 极道 · 2026-09-08T00:13:00Z
全球首款专为iPhone用户打造的Agent耳机正式发布,有道AI耳机让声音变成生产力

网易有道发布全球首款专为iPhone设计的AI耳机OpenPods,基于苹果MFi认证与AI Agent能力,整合录音、转写、翻译、总结等功能,覆盖会议、跨语言沟通等场景。耳机支持20余种语言,可生成纪要和知识库,单耳仅7克,续航32小时,8月27日预售,9月10日发售。

全球首款专为iPhone用户打造的Agent耳机正式发布,有道AI耳机让声音变成生产力

量子位 量子位 · 2026-08-28T02:48:37Z

谷歌Gemini Live推出重大升级,整合Spark功能,支持语音设置多步骤自主任务,如整理想法成文档、规划每周菜单。新增每日简报和免提邮件管理,可语音查询日程、搜索和归档邮件。借助个人智能,能记住过往对话,跨应用提供个性化回答,简化日常操作。

用Gemini Live的新生产力功能,将你的声音转化为行动

The Keyword The Keyword · 2026-08-26T17:00:00Z
IndexTTS 2.5 让声音跨越语言

B站发布IndexTTS 2.5语音合成模型,支持中英日西阿五语种零样本配音,推理速度提升2.28倍,并增强跨语言情绪还原与语速控制。团队通过降低语义帧率、换用Zipformer架构及GRPO强化学习优化性能,在情感迁移和说话人相似度上表现优异,旨在让创作者用任意声音、语言和情绪进行配音。

IndexTTS 2.5 让声音跨越语言

实时互动网 实时互动网 · 2026-08-17T07:32:30Z

作者在北京整租后,将电脑桌设在客厅,打造极简复古风格的个人角落。选用原木桌、飞利浦显示器、Mackie MR524音箱等设备,通过USB-C一线通简化线缆,享受独处时光。文章强调极简不是空无,而是保留常用之物,按自己节奏生活,让角落成为心灵栖息地。

角落新声|从合租到整租,我在客厅听见了自己的声音

少数派 少数派 · 2026-08-07T02:15:51Z
《宝可梦》开发工作室在《转生之兽》中难以找到自己的声音

Game Freak新作《Beast of Reincarnation》战斗流畅但缺乏新意。游戏设定在末日日本,主角艾玛可吸收怪物能力,但故事晦涩、谜团解答平淡,玩法简单,关卡设计直白。大量借鉴《尼尔》《怪物猎人》等作品,虽有忧郁氛围,但未能突破,令人失望。

《宝可梦》开发工作室在《转生之兽》中难以找到自己的声音

The Verge The Verge · 2026-08-04T00:00:00Z
解密注意力切换机制:大脑先抓新声音再放旧声音

大脑切换听觉注意力时,先快速抓取新声音,再缓慢放开旧声音,形成短暂的双重处理窗口。研究通过脑电图发现,大脑采用“先开后关”策略,并重置语义上下文,而非延续旧信息。这一发现颠覆传统认知,为助听器和脑机接口设计提供新思路,也揭示大脑与AI语言模型处理方式的差异。

解密注意力切换机制:大脑先抓新声音再放旧声音

极道 极道 · 2026-07-17T22:07:00Z
在线教学中如何突出老师的声音:ZEGO 焦点语音最佳实践

本文提出了一种基于ZEGO的手动混流方案,适用于大班和小班课,强调声音主权和焦点切换的管理。方案包括课堂混流管理、学生静音策略及录制回放等细节,旨在提升在线教学体验。

在线教学中如何突出老师的声音:ZEGO 焦点语音最佳实践

实时互动网 实时互动网 · 2026-07-17T02:15:00Z
直播场景中如何突出主播的声音:ZEGO 混流焦点语音实战

本文讨论了直播中主播声音干扰的问题,提出使用ZEGO的自动混流方案来解决。该方案通过标记主播流为焦点,自动管理音频流,确保主播声音突出,降低维护成本。文章还介绍了自动混流的实现步骤和适用场景,强调了其在直播中的优势。

直播场景中如何突出主播的声音:ZEGO 混流焦点语音实战

实时互动网 实时互动网 · 2026-07-17T01:18:39Z
多人会议中如何突出某个发言人的声音:ZEGO 混流焦点语音方案详解

本文介绍了ZEGO实时音视频SDK的混流焦点语音方案,旨在解决多人会议中重要发言人声音被淹没的问题。通过服务端混流,突出特定发言人的声音,适用于视频会议和在线课堂等场景。方案包括核心原理、关键API参数及实现步骤,强调统一控制和动态切换焦点的优势。

多人会议中如何突出某个发言人的声音:ZEGO 混流焦点语音方案详解

实时互动网 实时互动网 · 2026-07-16T09:04:34Z

文章探讨了“角落”的意义,作者在东莞的宿舍中寻找创作空间,重新定义理想的角落。通过简单的桌面和耳机,营造适合思考的环境。同时,作者在城市中探索咖啡馆和电影院,发现声音与空间的关系,强调角落不仅是物理空间,更是心灵的栖息地。

角落新声|在陌生的城市里,寻找属于自己的角落

少数派 少数派 · 2026-07-09T02:17:44Z
通过先进的模态条件和交互驯服文本到声音视频生成

该研究聚焦于文本到声音视频生成(T2SV),旨在从文本生成同步音频的视频。为解决文本条件瓶颈和跨模态特征交互机制不明确的问题,提出了交叉参考重写器(CRR)框架,通过提取语义锚点和生成解耦的字幕对,消除模态干扰,缩小训练与推理之间的差距。

通过先进的模态条件和交互驯服文本到声音视频生成

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-07T00:00:00Z

新西兰推出了一种新的Google Maps语音,能够正确发音毛利语地名,如“Taranaki”和“Whangārei”。此举旨在尊重毛利文化,提升对毛利语的认知。与毛利语言委员会合作,确保发音准确,并计划建立数据守护小组,支持毛利学者和社区。新语音已在Android和iOS平台上线。

新西兰的地图有了真实的新声音

The Keyword The Keyword · 2026-07-01T17:00:00Z
Netflix将在其《威利·旺卡》真人秀中使用AI生成的基因·怀尔德声音

Netflix将于9月23日首播以《威利·旺卡》为主题的真人秀《金票》,节目将使用AI生成的基因·怀尔德声音,并获得其家族同意。12名获胜者及其搭档将参与竞争,最终于9月30日决出冠军。

Netflix将在其《威利·旺卡》真人秀中使用AI生成的基因·怀尔德声音

The Verge The Verge · 2026-06-30T17:19:15Z
AI改了画面却没改声音?浙大团队首次将一句话编辑视频延伸到音频维度

浙江大学和腾讯团队提出了JAVEdit-100k数据集及评测基准JAVEditBench,填补了音视频联合编辑的空白。研究表明,JAVEdit在评测中表现优异,音视频同步性提升26%。该工作为多模态编辑提供了高质量资源,并指出音频基础模型的不足,未来需加强音频编辑能力。

AI改了画面却没改声音?浙大团队首次将一句话编辑视频延伸到音频维度

实时互动网 实时互动网 · 2026-06-22T07:18:57Z
麻省理工学院在媒体中的声音:为了科技的未来,马萨诸塞州绝对可以引领

麻省理工学院(MIT)领导和教职员工讨论如何在大波士顿地区促进创新和人才发展。MIT在2026年《波士顿环球报》发布的“科技领军人物”名单中有八位成员入选。MIT致力于推动人工智能和创业,推出免费在线AI课程,支持学生创业,并在能源、微芯片和清洁技术等领域进行创新,推动波士顿成为技术中心。

麻省理工学院在媒体中的声音:为了科技的未来,马萨诸塞州绝对可以引领

MIT News - Artificial intelligence MIT News - Artificial intelligence · 2026-06-18T04:00:00Z
Conclave是纽约夏季街区派对的声音

Conclave的自名专辑融合了拉丁节奏、合成低音和派对氛围,成为夏季热门音乐。曲目如“Habla”和“Perdón”展现了纽约街头文化,带来愉悦的舞动感。制作人Cesar Toribio巧妙融合多种音乐风格,创造出充满活力的音乐体验。该专辑可在主要流媒体平台上收听。

Conclave是纽约夏季街区派对的声音

The Verge The Verge · 2026-06-14T16:30:00Z
给 AI 语音聊天机器人定制人设和声线,用 prompt 还是微调还是声音克隆效果更好

本文探讨了AI语音聊天机器人的人设与声线设计,强调了三种主要方法:prompt工程、模型微调和声音克隆。prompt工程适合探索阶段,成本低、迭代快;模型微调提高人设辨识度和一致性;声音克隆确保声线独特性。最佳实践是结合三者,根据项目阶段逐步引入,以提升用户体验和产品差异化。

给 AI 语音聊天机器人定制人设和声线,用 prompt 还是微调还是声音克隆效果更好

实时互动网 实时互动网 · 2026-06-12T07:53:14Z

谷歌与Livity合作发布的《未来报告》调查了6000多名英国青少年的数字生活。报告显示,74%的青少年每周多次使用AI进行学习或创作,76%定期考虑信息的可信度,强调了为青少年提供安全的在线体验和负责任的AI教育的重要性。

阅读《未来报告》,我们的研究提升了英国青少年的声音。

The Keyword The Keyword · 2026-06-10T10:00:00Z
在线教程丨16GB笔记本跑出接近26B MoE性能,Gemma 4 12B基于创新架构统一处理文本/图像/声音三种模态

Google DeepMind 发布了新款多模态模型 Gemma 4 12B,参数为120亿,但在多项测试中表现接近260亿参数的模型。其无编码器架构显著降低了推理延迟和内存占用,支持音频输入,并可在普通笔记本上运行,降低了部署成本,为开发者提供了接近顶级性能的选择。

在线教程丨16GB笔记本跑出接近26B MoE性能,Gemma 4 12B基于创新架构统一处理文本/图像/声音三种模态

HyperAI超神经 HyperAI超神经 · 2026-06-10T03:09:51Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码