本文提出一套低延迟边云系统,集成六种流式视频VLM后端,共享ASR/TTS与统一编排,支持实时语音交互。实验显示,在合适后端与WebRTC传输下,首句VLM文本延迟约0.9–1.0秒,首段TTS音频约1.3–1.5秒。研究表明实时视频理解是分层系统问题,VLM到TTS交接尤为关键,低首token延迟并不保证快速语音响应。
完成下面两步后,将自动完成登录并继续当前操作。