小红花·文摘

speakrs 是一个用 Rust 实现的高速说话人分离工具，实时性能高达 529x，适合音频处理和会议转录。BoquilaHUB v0.5 更新了音频能力和 GUI 体验，增强了实时源功能。rproc 是 Linux 资源监控工具，提供直观的系统监控体验。Theta 是命令行工具，用于管理 AI Agent 配置，支持多平台，便于团队协作。

【Rust日报】2026-05-27 speakrs - 快速 Rust 说话人分离工具

Rust.cc ·

九个语音转文字方案效果深度对比报告

苍穹の下 ·

本研究提出了一种新声学条件方法，有效解决传统说话人分离系统在转换和重叠语音时的错误问题，显著降低了说话人错误率24-43%。

SEAL: Speaker Error Correction Using Acoustic Conditioned Large Language Models

BriefGPT - AI 论文速递 ·

本研究提出了一种新方法构建训练数据集，以改善说话人分离系统在真实录音环境中的表现。评估结果显示，该方法在真实混音条件下性能提升1.65 dB，验证了现实训练集对模型性能提升的潜力。

Developing an Effective Training Dataset to Enhance the Performance of AI-based Speaker Separation Systems

BriefGPT - AI 论文速递 ·

本研究提出了一种名为SepMamba的新方法，基于U-Net架构和双向Mamba层，旨在提高单通道说话人分离的计算效率。SepMamba在WSJ0 2数据集上的表现优于现有模型，显著降低了计算成本和内存占用。

SepMamba: A Speaker Separation Method Based on State Space Models

BriefGPT - AI 论文速递 ·

基于 Claude 3 和 WhisperX 构建 ASR 方案（一）

亚马逊AWS官方博客 ·

本研究提出了Sortformer神经模型，用于解决说话人分离中的排列问题。该模型采用了不同的训练目标，并引入了Sort Loss方法来改善排列解决能力。实验证明Sortformer在多说话人自动语音识别架构中表现出显著的性能提升。

Sortformer：通过时间戳与标记的桥接实现说话人分离与自动语音识别的无缝整合

BriefGPT - AI 论文速递 ·

本文介绍了一种音视频“位置时间标记”模型，结合多人视觉跟踪与多重语音源定位，解决了多人语音辨别问题。研究提出了新方法和数据集，显著提高了说话人分离的准确性和效率。

整合音频、视觉和语义信息以增强多模态说话者区分

BriefGPT - AI 论文速递 ·

本文提出了一种新的神经联合抄录模型（EEND），适用于长篇音频，显著降低了说话人分离误差（DER）和计算复杂性。该模型结合自我注意力机制和多任务学习，提升了多说话人场景下的说话人识别和分离性能。实验结果表明，该方法在多个数据集上均取得了显著的性能提升。

在端到端神经语音分离中利用说话者嵌入识别双方讲话的情景

BriefGPT - AI 论文速递 ·

本文介绍了一种新颖的自监督学习方法，结合分离机制和编码框架，有效实现说话人分离并提升语音识别性能。研究提出通过特征离散化和语音合成模型建模发言人特征的新方法，尤其在生成虚拟发言人方面表现出色。此外，改进的深度说话人嵌入在说话人验证任务中显著降低了错误率。

使用变长软池化方法从语音表示中去除说话人信息

BriefGPT - AI 论文速递 ·

该研究提出了一种新的模型，结合语音识别和说话人分离任务，通过引入说话人标签和掩码分支，实现了多说话人重叠语音的识别和分离。实验证明该方法在复杂的多说话人场景中有效提高了说话人分离的准确性。

多说话人重叠语音识别的演讲者掩蔽变换器

BriefGPT - AI 论文速递 ·

颠覆性语音识别：单词级时间戳和说话人分离 | 开源日报 No.53

开源服务指南 ·

本文提出了一种从多方会议语义内容中提取与讲话者相关信息的方法，改进说话人分离方法。该方法在 AISHELL-4 和 AliMeeting 数据集上相对于仅声学的说话人分离系统都有显著的改进。

多方对话中的协议检测：以演讲者划分和程序基准评估来增强用户参与

BriefGPT - AI 论文速递 ·