Sarvam AI 发布语音识别模型 Saaras V4,覆盖 22 种印度法定语言及全球英语口音,宣称均达最先进准确率。模型采用编码器-解码器架构,解码器为自研 30 亿参数混合状态空间模型。支持 5 种输出模式、最多 50 个关键词提示,流式首 token 时延低于 150 毫秒,定价 ₹30/小时。目前仅 API 可用,权重未公开,自托管仅支持 v3。所有数据均为厂商自报,尚无独立复现。
完成下面两步后,将自动完成登录并继续当前操作。