讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了!

讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线了!

💡 原文中文,约1400字,阅读约需4分钟。
📝

内容提要

讯飞发布全国产语音基座大模型Spark-Audio-1.0-Preview,采用0.65B音频编码器与30B-A3B MoE架构,基于国产算力、1300万小时音频训练。支持99种语言、202种方言的识别、翻译及情感分析,在复杂场景表现领先,部分评测超Gemini-3.1 Pro,文本能力未明显下降。

🔎

延伸解读

国产算力训练的意义

Spark-Audio-1.0-Preview是业界首个基于全国产算力训练的语音基座大模型,这标志着在国产算力平台上训练出业界领先水平的语音基座大模型成为可能。文章指出,该模型基于纯国产算力集群训练完成,证明了国产算力在大模型训练上的实力,为后续语音模型的自主可控发展提供了重要参考。

多语言与方言支持的实际价值

该模型支持99种语言和202种方言的识别,在Fleurs、Kespeech、LibriSpeech等评测中得分高于Gemini-3.1 Pro,并在Fleurs-中文测试集取得SOTA。这意味着在跨语言沟通、方言地区服务等场景中,模型能提供更准确的语音转写和翻译,减少因语言差异导致的理解障碍,对全球化业务或本地化服务有实用意义。

复杂场景下的性能优势

文章强调,Spark-Audio-1.0-Preview在高噪声、小音量等复杂条件下的语音识别任务中明显领先。这类场景更贴近真实应用,如车载、户外或远场交互。模型通过音频编码器预训练和后续训练提升了复杂场景泛化性,使其在嘈杂环境中仍能保持较好识别效果,为实际部署提供了可靠性基础。

文本能力与微调潜力

语音基座大模型常面临文本能力下降的问题,而Spark-Audio-1.0-Preview在通用知识、数学与代码等任务上没有明显降智,但在指令遵循、对话、音频理解上仍有进步空间。同时,模型支持微调,可开发语音识别、同传、交互等专用系统,便于在具体业务中落地,平衡通用性与定制化需求。

Q&A

讯飞星火Spark-Audio-1.0-Preview是什么?

讯飞星火Spark-Audio-1.0-Preview是讯飞发布的全国产语音基座大模型,采用0.65B音频编码器和30B-A3B MoE大语言模型,基于纯国产算力集群训练,支持文本和语音双模态输入,可完成语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及复杂音频问答等任务。

Spark-Audio-1.0-Preview支持多少种语言和方言?

Spark-Audio-1.0-Preview支持99种语言及202种方言的识别。

Spark-Audio-1.0-Preview在哪些评测中表现领先?

在Fleurs、Kespeech、LibriSpeech等中英文、多语言、多方言语音识别评测中,Spark-Audio-1.0-Preview得分高于Gemini-3.1 Pro;在Fleurs-中文测试集中取得SOTA。在复杂场景高噪声、小音量等真实应用类任务中也有明显领先优势。

Spark-Audio-1.0-Preview是如何训练出来的?

Spark-Audio-1.0-Preview通过音频编码器预训练逐步扩展表征能力,再经过预训练和后训练提升基础能力、复杂场景泛化性及多任务效果,最终在99种语言、202种方言及高噪声、小音量等复杂场景下取得优异成绩。

Spark-Audio-1.0-Preview在文本任务上是否会出现能力下降?

没有出现明显降智。Spark-Audio-1.0-Preview在通用知识、数学与代码等任务上未明显下降,同时在指令遵循、对话、音频理解等任务上仍有进步追赶空间。

Spark-Audio-1.0-Preview的国产化程度如何?

Spark-Audio-1.0-Preview是业界首个基于全国产算力训练的语音基座大模型,基于纯国产算力集群训练完成,证明了在国产算力上完全有能力训练出效果达到业界领先水平的语音基座大模型。

🏷️

标签

➡️

继续阅读