Speakr是一款免费开源的自我托管转录平台,支持本地或云端后端(如WhisperX、OpenAI),提供高隐私、无月度限制的音频转文字服务。它通过Docker部署,具备AI摘要、说话人识别、语义搜索、协作共享及自动化工作流功能。适合处理敏感数据的专业人士,但需注意API费用或GPU硬件要求。
本文讲解如何用Python构建音频转文字应用,使用OpenAI API、pydub和python-dotenv库。内容涵盖项目设置、库安装、API密钥配置及代码编写。核心功能是将音频转换为单声道16kHz格式,并用Whisper API转录。示例代码展示了具体实现。
完成下面两步后,将自动完成登录并继续当前操作。