自变量机器人提出X2-NativeCursor,用约2M参数进度模型直接从TTS原生语音token估计原文位置,无需ASR或波形对齐。结合播放时钟确定播报进度,支持打断后续读、字幕高亮等。中文位置误差低于在线基线,RTF从0.36降至0.018,并可适配CosyVoice2等不同TTS。
完成下面两步后,将自动完成登录并继续当前操作。