写一个语音编程扩展插件
内容提要
作者更新语音交互包,提升与 agent 对话的输入效率。支持三种模式:/voice 停顿自动转写、/voice ptt 按住空格说话、/voice auto 免手操。转写采用 SenseVoice,支持中英日韩粤并自动标点;回复用 Edge TTS 朗读并剥离 Markdown。可通过 rpi 安装,模型约 240MB 自动下载,仓库已开源,欢迎 PR 和 star。
延伸解读
三种语音模式如何选
文章介绍了 /voice、/voice ptt 和 /voice auto 三种模式。普通模式适合说一段后停顿自动转写;ptt 模式按住空格说话,松手发送,适合精确控制;auto 模式免手操,但打字会暂停。读者可根据场景选择:快速输入用普通,嘈杂环境用 ptt,长任务追加约束用 auto。
离线转写与语音朗读的配置要点
转写采用 SenseVoice,支持中英日韩粤并自动标点,模型约 240MB 首次自动下载。朗读使用 Edge TTS,默认音色 zh-CN-XiaoxiaoNeural,可通过 /voice set 更换。若想全离线,需自行编译 rpi-voice,因为原生库未包含在默认包中。
安装与使用前的准备
安装 rpi 有多种方式:预编译脚本、cargo、brew 或 scoop。之后用 rpi install rpi-voice 安装扩展。运行 rpi 后,可用 /voice model download 预取模型,/voice ptt 开启按住说话,/voice status 查看设备与音色。仓库已开源,欢迎 PR 和 star。
Q&A
语音编程扩展插件支持哪些语音交互模式?
支持三种模式:/voice 停顿自动转写、/voice ptt 按住空格说话、/voice auto 免手操。
语音转写支持哪些语言?
支持中英日韩粤,自动判语言,自带标点。
如何安装 rpi 和 rpi-voice?
安装 rpi 可选:curl 脚本、cargo install rpi-cli、brew 或 scoop。安装 rpi-voice 可运行 rpi install rpi-voice,想全离线需自己编译。
语音转写模型是什么?需要下载吗?
转写用 SenseVoice(sherpa-onnx 静态链进扩展),模型约 240MB,放在 ~/.rpi/agent/models/sense-voice/,首次使用自动下载。
如何更换 TTS 朗读音色?
默认音色是 zh-CN-XiaoxiaoNeural,可用 /voice set zh-CN-YunxiNeural 换男声。
语音回复朗读时如何处理 Markdown?
朗读前会把 Markdown 剥掉,不会念星号和 URL。