开源初探 - stt
原文中文,约4100字,阅读约需10分钟。
📝
内容提要
这是一个离线运行的本地语音识别转文字工具,基于fast-whisper开源模型。可将视频/音频中的人类声音识别并转为文字,可输出json格式、srt字幕带时间戳格式、纯文字格式。准确率基本等同openai官方api接口。需要安装CUDA和NVIDIA Container Toolkit。使用docker安装运行。下载模型文件并运行stt。可使用wav或mp3文件进行测试。转换结果准确率大概90%左右。项目地址:https://github.com/jianchang512/stt。
🏷️