小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
解密注意力切换机制:大脑先抓新声音再放旧声音

你的大脑每次切换注意力时,都在偷偷进行一场不对称战争。 最新脑科学研究发现,当你在嘈杂环境中切换听话对象时,大脑对旧声音的“放手”速度远远慢于对新声音的“抓取”速度,中间还会出现一个两路声音同时被大脑清晰解码的短暂窗口。这项发表在《PLOS生物学》上的研究,通过脑电图实验颠覆了我们对听觉注意力的传统认知,也为未来智能助听器和脑机接口开发提供了全新神经解码思路。...

解密注意力切换机制:大脑先抓新声音再放旧声音

极道
极道 · 2026-07-17T22:07:00Z
在线教学中如何突出老师的声音:ZEGO 焦点语音最佳实践

本文提出了一种基于ZEGO的手动混流方案,适用于大班和小班课,强调声音主权和焦点切换的管理。方案包括课堂混流管理、学生静音策略及录制回放等细节,旨在提升在线教学体验。

在线教学中如何突出老师的声音:ZEGO 焦点语音最佳实践

实时互动网
实时互动网 · 2026-07-17T02:15:00Z
直播场景中如何突出主播的声音:ZEGO 混流焦点语音实战

本文讨论了直播中主播声音干扰的问题,提出使用ZEGO的自动混流方案来解决。该方案通过标记主播流为焦点,自动管理音频流,确保主播声音突出,降低维护成本。文章还介绍了自动混流的实现步骤和适用场景,强调了其在直播中的优势。

直播场景中如何突出主播的声音:ZEGO 混流焦点语音实战

实时互动网
实时互动网 · 2026-07-17T01:18:39Z
多人会议中如何突出某个发言人的声音:ZEGO 混流焦点语音方案详解

本文介绍了ZEGO实时音视频SDK的混流焦点语音方案,旨在解决多人会议中重要发言人声音被淹没的问题。通过服务端混流,突出特定发言人的声音,适用于视频会议和在线课堂等场景。方案包括核心原理、关键API参数及实现步骤,强调统一控制和动态切换焦点的优势。

多人会议中如何突出某个发言人的声音:ZEGO 混流焦点语音方案详解

实时互动网
实时互动网 · 2026-07-16T09:04:34Z

文章探讨了“角落”的意义,作者在东莞的宿舍中寻找创作空间,重新定义理想的角落。通过简单的桌面和耳机,营造适合思考的环境。同时,作者在城市中探索咖啡馆和电影院,发现声音与空间的关系,强调角落不仅是物理空间,更是心灵的栖息地。

角落新声|在陌生的城市里,寻找属于自己的角落

少数派
少数派 · 2026-07-09T02:17:44Z
通过先进的模态条件和交互驯服文本到声音视频生成

该研究聚焦于文本到声音视频生成(T2SV),旨在从文本生成同步音频的视频。为解决文本条件瓶颈和跨模态特征交互机制不明确的问题,提出了交叉参考重写器(CRR)框架,通过提取语义锚点和生成解耦的字幕对,消除模态干扰,缩小训练与推理之间的差距。

通过先进的模态条件和交互驯服文本到声音视频生成

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-07T00:00:00Z

新西兰推出了一种新的Google Maps语音,能够正确发音毛利语地名,如“Taranaki”和“Whangārei”。此举旨在尊重毛利文化,提升对毛利语的认知。与毛利语言委员会合作,确保发音准确,并计划建立数据守护小组,支持毛利学者和社区。新语音已在Android和iOS平台上线。

新西兰的地图有了真实的新声音

The Keyword
The Keyword · 2026-07-01T17:00:00Z
Netflix将在其《威利·旺卡》真人秀中使用AI生成的基因·怀尔德声音

Netflix将于9月23日首播以《威利·旺卡》为主题的真人秀《金票》,节目将使用AI生成的基因·怀尔德声音,并获得其家族同意。12名获胜者及其搭档将参与竞争,最终于9月30日决出冠军。

Netflix将在其《威利·旺卡》真人秀中使用AI生成的基因·怀尔德声音

The Verge
The Verge · 2026-06-30T17:19:15Z
AI改了画面却没改声音?浙大团队首次将一句话编辑视频延伸到音频维度

浙江大学和腾讯团队提出了JAVEdit-100k数据集及评测基准JAVEditBench,填补了音视频联合编辑的空白。研究表明,JAVEdit在评测中表现优异,音视频同步性提升26%。该工作为多模态编辑提供了高质量资源,并指出音频基础模型的不足,未来需加强音频编辑能力。

AI改了画面却没改声音?浙大团队首次将一句话编辑视频延伸到音频维度

实时互动网
实时互动网 · 2026-06-22T07:18:57Z
麻省理工学院在媒体中的声音:为了科技的未来,马萨诸塞州绝对可以引领

麻省理工学院(MIT)领导和教职员工讨论如何在大波士顿地区促进创新和人才发展。MIT在2026年《波士顿环球报》发布的“科技领军人物”名单中有八位成员入选。MIT致力于推动人工智能和创业,推出免费在线AI课程,支持学生创业,并在能源、微芯片和清洁技术等领域进行创新,推动波士顿成为技术中心。

麻省理工学院在媒体中的声音:为了科技的未来,马萨诸塞州绝对可以引领

MIT News - Artificial intelligence
MIT News - Artificial intelligence · 2026-06-18T04:00:00Z
Conclave是纽约夏季街区派对的声音

Conclave的自名专辑融合了拉丁节奏、合成低音和派对氛围,成为夏季热门音乐。曲目如“Habla”和“Perdón”展现了纽约街头文化,带来愉悦的舞动感。制作人Cesar Toribio巧妙融合多种音乐风格,创造出充满活力的音乐体验。该专辑可在主要流媒体平台上收听。

Conclave是纽约夏季街区派对的声音

The Verge
The Verge · 2026-06-14T16:30:00Z
给 AI 语音聊天机器人定制人设和声线,用 prompt 还是微调还是声音克隆效果更好

本文探讨了AI语音聊天机器人的人设与声线设计,强调了三种主要方法:prompt工程、模型微调和声音克隆。prompt工程适合探索阶段,成本低、迭代快;模型微调提高人设辨识度和一致性;声音克隆确保声线独特性。最佳实践是结合三者,根据项目阶段逐步引入,以提升用户体验和产品差异化。

给 AI 语音聊天机器人定制人设和声线,用 prompt 还是微调还是声音克隆效果更好

实时互动网
实时互动网 · 2026-06-12T07:53:14Z

谷歌与Livity合作发布的《未来报告》调查了6000多名英国青少年的数字生活。报告显示,74%的青少年每周多次使用AI进行学习或创作,76%定期考虑信息的可信度,强调了为青少年提供安全的在线体验和负责任的AI教育的重要性。

阅读《未来报告》,我们的研究提升了英国青少年的声音。

The Keyword
The Keyword · 2026-06-10T10:00:00Z
在线教程丨16GB笔记本跑出接近26B MoE性能,Gemma 4 12B基于创新架构统一处理文本/图像/声音三种模态

Google DeepMind 发布了新款多模态模型 Gemma 4 12B,参数为120亿,但在多项测试中表现接近260亿参数的模型。其无编码器架构显著降低了推理延迟和内存占用,支持音频输入,并可在普通笔记本上运行,降低了部署成本,为开发者提供了接近顶级性能的选择。

在线教程丨16GB笔记本跑出接近26B MoE性能,Gemma 4 12B基于创新架构统一处理文本/图像/声音三种模态

HyperAI超神经
HyperAI超神经 · 2026-06-10T03:09:51Z
AI语音机器人被播客、MP3文件和YouTube视频中的“隐藏”声音劫持

研究人员展示了一种新型攻击,称为“音频劫持”,通过微小音频变化操纵语音助手,执行未经授权的操作,成功率高达96%。该攻击不需直接访问设备,可能在Zoom等会议中实施。微软对此研究表示欢迎,但强调需采取额外保护措施。

AI语音机器人被播客、MP3文件和YouTube视频中的“隐藏”声音劫持

实时互动网
实时互动网 · 2026-05-25T02:44:56Z
假如听不见声音,该如何「感触」音乐?

王朝晖首次用iPhone让失聪的母亲王书珍体验音乐,通过震动感受《远山》,王书珍兴奋地表示喜欢。导演沈煜傑记录了这一感人瞬间,展现了母子间深厚的情感。

假如听不见声音,该如何「感触」音乐?

爱范儿
爱范儿 · 2026-05-21T10:11:40Z

玩过《暗黑地牢》系列的玩家,应该都对游戏中“先祖”的沙哑而阴沉的配音印象深刻。从游戏最初序章动画中娓娓道来的台词,再到游戏过程中粗粝而低沉的旁白,这个声音伴随了《暗黑地牢》玩家几乎全部的游戏时长,也成为了这个系列标志性阴郁残酷气质的一部分。视频来自B站UP主@艾露Smile___尽管并非专业的游戏配音演员,但为“先祖”献声的Wayne...

核心配音演员去世后,《暗黑地牢》开发商拒绝使用AI继续生成他的声音

游戏研究社
游戏研究社 · 2026-05-13T16:00:00Z

KeyClicker是一款苹果电脑软件,模拟机械键盘的打字声音,提供多种音效选择。用户可以为特定按键设置音效或静音,特别适合旧款MacBook Pro用户,以帮助判断输入是否成功。

Mac技巧之让苹果电脑在打字时发出机械键盘和打字机的声音:KeyClicker

苹果fans博客
苹果fans博客 · 2026-05-10T15:39:23Z

文章讨论了iOS系统中键盘输入延迟的问题,特别是在使用蓝牙耳机时。通过关闭“锁定声”和“键盘反馈”设置,以及调整“按键重复”设置,可以减少延迟并改善输入体验。作者希望苹果能重视这些细节,并鼓励读者分享解决方案。

一日一技|为什么你应该关闭 iOS 的键盘声音

少数派
少数派 · 2026-05-07T08:38:27Z
OpenMOSS发布MOSS-Audio:一个用于语音、声音、音乐和时间感知音频推理的开源基础模型

MOSS-Audio是一个开源音频理解模型,集成了语音转录、情感分析和环境声音理解等功能。其模块化设计包括音频编码器和大型语言模型,采用DeepStack跨层特征注入和时间感知表示技术,显著提升了音频处理能力。MOSS-Audio-8B-Thinking在音频理解基准测试中表现优异,准确率达到71.08%。

OpenMOSS发布MOSS-Audio:一个用于语音、声音、音乐和时间感知音频推理的开源基础模型

实时互动网
实时互动网 · 2026-04-28T03:00:32Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码