字节跳动推出原生音视频全双工大模型SeedRealtime,采用统一架构融合音频、视频与文本,实现边看、边听、边说。该模型支持音视频联合理解、主动交互和流畅节奏,减少对话卡顿,已在豆包App上线。未来将优化延迟、多人场景和工具调用。
完成下面两步后,将自动完成登录并继续当前操作。