内容提要
mod_earshot 是一个开源模块,通过单个 WebSocket 将实时电话通话桥接到 AI 语音代理,支持全双工通信。它提供多种协议适配器、轮流发言机制、通话控制、PCI/PII 屏蔽、多流工作及高效扩展,适合部署在自有基础设施上。
延伸解读
部署模式与成本优势
mod_earshot 强调在自有基础设施上运行,而非依赖黑盒 SaaS。这意味着企业可以保留对音频数据和通话记录的控制,同时避免按分钟支付合规附加费。对于已有 FreeSWITCH 或 SIP 环境的团队,该模块可无缝集成,降低迁移成本。但需注意,自托管要求具备相应的运维能力,包括处理 WebSocket 连接、扩展性和监控。
扩展性对比与资源占用
文章指出,mod_earshot 按会话扩展,每个会话约占用 1 MB 内存,而每流一线程模式在约 420 路时遇到瓶颈。这意味着在相同硬件上,mod_earshot 可支持数千路并发通话,显著提升资源利用率。对于高并发场景,如呼叫中心,这种设计能有效降低基础设施成本。但实际性能还受网络带宽、CPU 处理能力等因素影响,需进行压力测试验证。
安全与合规特性
PCI/PII 屏蔽功能在本地完成,避免敏感数据外传,符合支付卡行业数据安全标准(PCI DSS)等合规要求。通过静音音频和脱敏 DTMF,确保银行卡信息不被 AI 代理或第三方记录。此外,代理操作均有审计记录,便于追踪和合规审查。但需注意,屏蔽功能仅针对音频和 DTMF,其他数据通道(如文本)可能仍需额外保护。
Q&A
mod_earshot是什么?它主要解决什么问题?
mod_earshot是一个开源模块,通过单个WebSocket将实时电话通话桥接到AI语音代理,支持全双工通信。它主要解决将AI语音代理接入真实电话线路并部署在自有基础设施上的问题,避免使用黑盒SaaS。
mod_earshot支持哪些AI语音代理协议?如何切换供应商?
mod_earshot支持7种协议适配器:OpenAI Realtime、Deepgram、ElevenLabs、Gemini、Pipecat、Twilio或自定义WebSocket。切换供应商只需修改一个词(即适配器名称)。
mod_earshot如何实现轮流发言机制?
mod_earshot实现了适用于任何代理的轮流发言机制,包括模块侧VAD(语音活动检测)、就绪门控(避免接通后静音)以及语音触发的打断插话功能。
mod_earshot支持哪些通话控制功能?
mod_earshot允许代理控制通话,包括白名单式转接、挂断、DTMF、保持和桥接,并且每个动作都有审计记录。
mod_earshot如何处理PCI/PII数据以符合合规要求?
mod_earshot支持PCI/PII屏蔽,在输入银行卡信息期间静音音频并脱敏DTMF,且完全在自有机器上处理,无需按分钟支付合规附加费。
mod_earshot的扩展性如何?相比传统模式有什么优势?
mod_earshot按会话扩展而非按线程扩展,共享libwebsockets池每个会话约占用1MB内存,小型服务器可承载数千路并发通话;而每流一线程模式在约420路时遇到瓶颈。
mod_earshot如何实现可观测性?
mod_earshot通过FreeSWITCH事件套接字(ESL)发送类型化事件和延迟KPI,包括首段音频时间、每轮响应时间和WebSocket RTT。