内容提要
本文探讨语音智能体延迟指标,指出TTFT(首Token时间)仅是起点,真正影响体验的是TTFS(首句时间)。文章基准测试了LLM、STT、TTS及语音到语音各层,强调需结合TTFT和输出速度评估,并给出约700ms的LLM预算参考。关键建议包括同区域部署、限制推理努力、预留工具调用预算,以及关注p95尾部延迟而非仅p50。
延伸解读
TTFT与TTFS:语音场景下的关键差异
文章指出,TTFT(首Token时间)只是生成开始的时刻,而TTS需要完整子句才能合成语音,因此真正影响用户体验的是TTFS(首句时间)。这意味着在评估语音智能体时,不能只看TTFT,还需结合输出速度(每秒token数)来综合判断。例如,Cerebras的gpt-oss-120b虽然TTFT为0.49秒,但输出速度高达1697 tok/s,能快速完成首句;而Inception的Mercury 2虽然输出速度770 tok/s,但TTFT高达3.07秒,首句等待过长。因此,选择API时需同时关注这两个指标。
推理努力:最大的延迟杠杆
文章强调,推理努力(reasoning effort)是影响TTFT的最大单一因素。以Gemini 3.1 Flash Live为例,从Minimal档位到High档位,TTFA从0.96秒增至2.99秒,而任务成功率仅提升约2个百分点。OpenAI的GPT-Realtime-2.1也类似,从0.97秒增至1.21秒。因此,在实际部署中,应显式限制推理努力,以在延迟和效果之间取得平衡。这通常是一个配置开关,无需更换模型。
同区域部署与尾部延迟的重要性
文章建议,在优化模型之前,应先确保智能体与模型服务同区域部署,因为网络延迟对整体体验影响极大。此外,应关注p95尾部延迟而非仅p50中位数,因为尾部延迟才是导致语音智能体“感觉坏掉”的元凶。OpenAI在2026年7月发布的Realtime模型改进中,就特别强调了p95延迟降低至少25%。因此,在监控和优化时,应重点跟踪p95指标。
工具调用与基础设施的隐藏成本
文章提醒,任何带工具调用的回合都会使LLM延迟大约翻倍,因此需要为工具调用预留预算,例如限制max_tool_steps、合并外部API调用,或播放“思考中”提示音。此外,基础设施选择也至关重要:在AWS t3、t4g等突发性能型实例上自托管智能体,即使CPU占用低,也可能遭遇严重延迟和轮次检测超时。这些因素往往被忽视,但会显著影响实际体验。
Q&A
为什么说TTFT不是衡量语音智能体延迟的最佳指标?
因为TTFT只表示生成开始的时刻,而TTS需要等到完整子句才能开始说话,真正影响用户体验的是首句时间(TTFS),即从请求到第一句话说完的时间。TTFT和输出速度(每秒token数)共同决定TTFS,因此只看TTFT会误导评估。
语音智能体一个回合的延迟预算大概是多少?
根据LiveKit,一个回合的延迟预算约为700ms到1.2s,其中STT约100-200ms,LLM推理300-500ms,TTS 100-200ms,网络开销50-150ms。Pipecat联合创始人建议中位目标800ms,概念验证可放宽到1500ms。
在LLM首Token时间基准测试中,哪个模型表现最好?
在Artificial Analysis的10k输入token工作负载下,Baseten托管的gpt-oss-120b(high)以0.23s的TTFT和266 tok/s的输出速度排名第一。
为什么高吞吐量模型不一定适合语音智能体?
因为高吞吐量(每秒token数)只影响句子完成速度,而TTFT决定生成开始时间。例如Inception的Mercury 2吞吐量达770 tok/s,但TTFT高达3.07s,是自然对话LLM预算的四倍,导致整体延迟过高。
如何降低语音智能体的LLM延迟?
关键方法包括:同区域部署(与模型服务器地理邻近)、显式限制推理努力(reasoning effort)、预留工具调用预算(工具调用会使延迟翻倍)、使用投机解码等技术。
为什么语音到语音模型不一定比级联管线更快?
虽然语音到语音模型将STT、LLM、TTS压缩为一次推理,但LiveKit指出实时模型并不保证在所有情况下更快,调校得当的级联管线可以极具竞争力。Daily的基准测试显示,级联模型在工具调用和指令遵循上能力更强,因此许多生产级智能体仍使用级联。
在STT延迟方面,Deepgram Flux有什么独特之处?
Deepgram Flux将端轮检测(end-of-turn detection)集成到识别模型中,而非外挂VAD,可削减200-600ms的响应延迟。它提供eot_threshold和eager_eot_threshold参数,并支持EagerEndOfTurn事件,允许提前启动LLM,从而将LLM的TTFT移出关键路径。
TTS延迟中,厂商宣称的75ms或90ms代表什么?
这些数字通常仅指模型推理时间,不包括网络往返(20-200ms)和播放器缓冲(常见500ms)。例如ElevenLabs Flash v2.5的75ms是纯推理时间,实际端到端延迟会更高。
在语音到语音基准测试中,哪个模型表现最佳?
Grok Voice Think Fast 2.0 High以0.70s的TTFA(首音频时间)和97%的语音推理成功率、94.7%的任务成功率位居榜首。
为什么建议关注p95延迟而不是p50?
因为语音智能体在尾部延迟(如p95)过高时会感觉“坏掉”,中位数改进可能掩盖尾部问题。OpenAI在2026年7月通过改进缓存使Realtime语音模型系列的p95延迟降低至少25%,这比中位数改进更有意义。