S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本

S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本

💡 原文中文,约3100字,阅读约需8分钟。
📝

内容提要

Superwhisper发布S1系列,其中S1-mini为开源0.6B文本规范化模型,基于Qwen3微调,将ASR转录转为整洁文本,支持风格、结构、上下文三轴控制。Q4量化仅462MB,可本地部署。需关闭思考模式并贪心解码,测试token准确率94.8%。云端S1-Voice和S1-Language提供转录与格式化服务。

🔎

延伸解读

部署注意事项

S1-mini 虽小,但部署时需注意两个关键设置:必须关闭思考模式(enable_thinking=False),并使用贪心解码(temperature 0)。否则可能无法获得可用输出或质量下降。此外,模型仅支持英语,输入建议约 1000 token,且控制线值需在指定范围内,否则输出可能退化。

控制线机制

S1-mini 通过固定系统提示词加三轴控制线(风格、结构、上下文)驱动,每个维度独立且组合均经过训练。但需注意,Superwhisper 应用暴露五档语调滑块,而开源权重仅支持四档风格值,存在不一致。集成时需严格遵循文档中的值,避免自定义。

评估结果解读

厂商报告在内部测试集上 token 准确率 94.8%,邮件格式识别率高,但这是厂商自报结果,非第三方独立验证。实际效果可能因场景而异,建议在真实数据上测试。模型设计上不会添加内容或纠正事实,仅含语气词的输入会返回空字符串,集成时需处理。

Q&A

S1-mini是什么?它有什么用途?

S1-mini是Superwhisper发布的一个0.6B参数的开源文本规范化模型,基于Qwen3微调。它位于自动语音识别(ASR)之后,将原始转录文本重写为整洁的书面文本:移除语气词、解析自我修正、应用标点和大小写,并将口语化的数字、日期、货币和邮箱地址渲染为书面形式。它不是转录器,也不是聊天模型。

S1-mini的模型参数和量化大小是多少?

S1-mini有596M个独立参数(0.44B非嵌入参数),28层,16个查询头和8个键值头(GQA),权重为BF16。Q4_K_M GGUF构建仅有462MB,可在笔记本CPU上运行。

S1-mini的控制线是什么?如何控制输出风格?

S1-mini接收一个固定的系统提示词,然后是一条控制线,包含三个维度:Styling(风格)可选casual、semi-casual、semi-formal或formal;Structure(结构)可选prose或lists;Context(上下文)可选general或email。三个维度相互独立,每种组合都经过训练。如果传入这些集合之外的值,输出可能会退化或乱码。

部署S1-mini时需要注意哪些关键设置?

必须启用enable_thinking=False,因为Qwen3默认开启思考模式,而S1-mini训练时关闭了思考模式。另外,必须使用贪心解码,即temperature设为0,因为generation_config.json出厂设置do_sample: false,但GGUF构建仍带有temp=0.6等元数据,所以每次请求都要显式传入temperature 0。在llama.cpp中,使用--jinja配合--chat-template-kwargs '{"enable_thinking":false}',而不是--reasoning-budget 0。

S1-mini的评估结果如何?

Superwhisper在7,519条留出用例、104条转录文本上评估,使用Q4_K_M构建贪心解码,token准确率为94.8%,文本编辑错误率为11.6%。在邮件格式文本上,99.3%正确识别问候行,97.9%正确识别落款行。97.6%匹配正确输出结构,92%生成精确邮箱地址。不到1%生成出现循环或截断,98.6%正确不输出。这些是厂商内部测试集报告的数字,非第三方结果。

S1-mini与S1-Voice和S1-Language有什么区别?

S1-mini是开源权重模型,可自托管,用于文本规范化。S1-Voice是托管的语音转文本模型,S1-Language是托管的指令跟随模型,用于清理、格式化和摘要,两者都是Superwhisper托管的服务,无法自托管。S1-mini可离线使用,而S1-Voice和S1-Language需要云端调用。

🏷️

标签

➡️

继续阅读