写一个语音编程扩展插件

💡 原文中文,约1200字,阅读约需3分钟。
📝

内容提要

作者更新语音交互包,提升与 agent 对话的输入效率。支持三种模式:/voice 停顿自动转写、/voice ptt 按住空格说话、/voice auto 免手操。转写采用 SenseVoice,支持中英日韩粤并自动标点;回复用 Edge TTS 朗读并剥离 Markdown。可通过 rpi 安装,模型约 240MB 自动下载,仓库已开源,欢迎 PR 和 star。

🔎

延伸解读

三种语音模式如何选

文章介绍了 /voice、/voice ptt 和 /voice auto 三种模式。普通模式适合说一段后停顿自动转写;ptt 模式按住空格说话,松手发送,适合精确控制;auto 模式免手操,但打字会暂停。读者可根据场景选择:快速输入用普通,嘈杂环境用 ptt,长任务追加约束用 auto。

离线转写与语音朗读的配置要点

转写采用 SenseVoice,支持中英日韩粤并自动标点,模型约 240MB 首次自动下载。朗读使用 Edge TTS,默认音色 zh-CN-XiaoxiaoNeural,可通过 /voice set 更换。若想全离线,需自行编译 rpi-voice,因为原生库未包含在默认包中。

安装与使用前的准备

安装 rpi 有多种方式:预编译脚本、cargo、brew 或 scoop。之后用 rpi install rpi-voice 安装扩展。运行 rpi 后,可用 /voice model download 预取模型,/voice ptt 开启按住说话,/voice status 查看设备与音色。仓库已开源,欢迎 PR 和 star。

❓

Q&A

语音编程扩展插件支持哪些语音交互模式?

支持三种模式:/voice 停顿自动转写、/voice ptt 按住空格说话、/voice auto 免手操。

语音转写支持哪些语言?

支持中英日韩粤,自动判语言,自带标点。

如何安装 rpi 和 rpi-voice?

安装 rpi 可选:curl 脚本、cargo install rpi-cli、brew 或 scoop。安装 rpi-voice 可运行 rpi install rpi-voice,想全离线需自己编译。

语音转写模型是什么?需要下载吗?

转写用 SenseVoice(sherpa-onnx 静态链进扩展),模型约 240MB,放在 ~/.rpi/agent/models/sense-voice/,首次使用自动下载。

如何更换 TTS 朗读音色?

默认音色是 zh-CN-XiaoxiaoNeural,可用 /voice set zh-CN-YunxiNeural 换男声。

语音回复朗读时如何处理 Markdown?

朗读前会把 Markdown 剥掉,不会念星号和 URL。

🏷️

标签

➡️

继续阅读