内容提要
Conversationaly是一款隐私优先的开源AI会议助手,支持本地录音、实时转写和摘要生成,默认不联网、无云端依赖。它基于transcribe.cpp和llama.cpp重构,支持85种模型,默认用parakeet模型(WER 1.94%),并内置Gemma 4生成摘要。用户可选云端服务,但需主动配置。应用支持多平台,但未签名,首次运行需手动放行。
延伸解读
本地与云端的权衡
Conversationaly默认本地处理,但用户可主动配置云端服务,如Deepgram、OpenAI等。这种设计让用户根据隐私需求和硬件性能灵活选择。然而,本地运行大模型对硬件有要求,尤其是GPU显存不足时,摘要生成可能缓慢或无法运行。文章未明确说明最低配置,用户需自行测试。
模型选择与准确率
默认转写模型parakeet-tdt-0.6b-v3-q8的WER为1.94%,与云端服务相当。但模型为GGUF格式,经过8-bit量化,可能带来精度损失。用户可根据语言需求选择其他模型,如支持32种语言的nemotron-3.5-asr-streaming-0.6b-q8。不过,模型下载需数百MB至数GB,首次使用需注意存储空间。
安装与权限注意事项
应用未签名,macOS和Windows首次运行需手动放行。macOS还需屏幕录制权限以捕获系统音频,但应用仅使用音频通道,不录制屏幕。用户可能因误解而拒绝权限,导致功能异常。建议首次启动时仔细阅读权限说明,避免操作失误。
Q&A
Conversationaly是什么?它有哪些主要功能?
Conversationaly是一款隐私优先的开源AI会议助手桌面应用,支持macOS、Windows和Linux。主要功能包括本地录音(麦克风和系统音频)、实时转写、自动生成会议摘要,所有处理默认在本地完成,无需账户和云端。
Conversationaly如何保证数据隐私?
Conversationaly默认所有处理都在本地完成,不联网、无云端依赖、无遥测。用户数据(录音、转写、摘要)保存在本地SQLite数据库和模型目录中。只有用户主动配置云端API密钥时,数据才会发送到云端服务。
Conversationaly支持哪些转写模型?默认模型是什么?
Conversationaly支持85种模型,涵盖16个模型家族(如Whisper、Parakeet、Nemotron、Canary、Qwen3-ASR、SenseVoice等)。默认模型是parakeet-tdt-0.6b-v3-q8,词错误率(WER)为1.94%,支持25种欧洲语言。
Conversationaly的摘要功能是如何工作的?
Conversationaly内置llama-helper服务,本地运行Gemma 4模型生成摘要。用户也可以配置外部LLM提供商,如Ollama、Claude、Groq、OpenRouter、OpenAI等。摘要功能默认使用本地模型,无需额外配置。
Conversationaly支持哪些云端服务?如何启用?
Conversationaly支持云端STT(Deepgram、ElevenLabs、Groq、OpenAI)和云端摘要(Ollama、Claude、Groq、OpenRouter、OpenAI等)。这些服务都是可选的(opt-in),用户必须主动配置API密钥,数据才会离开本地机器。
Conversationaly如何同时录制麦克风和系统音频?
Conversationaly使用专业音频混音技术,同时捕获麦克风和系统音频。在macOS上使用ScreenCaptureKit(需要屏幕录制权限),Windows上使用WASAPI回环,Linux上使用PulseAudio或PipeWire。混音时采用RMS音量避让和防削波功能,防止音量冲突。
Conversationaly支持哪些GPU加速?没有GPU怎么办?
Conversationaly支持Apple Silicon(Metal)、NVIDIA(CUDA)、AMD/Intel(Vulkan)和AMD on Linux(ROCm)四种GPU加速后端。如果没有GPU,CPU也能运行,但实时转写可能需要等待。
Conversationaly的安装和权限要求有哪些?
Conversationaly提供预编译安装包(macOS .dmg、Windows .exe、Linux .deb/.rpm/.AppImage),也支持Homebrew和Scoop。但所有构建都没有代码签名,首次运行需要手动放行。权限方面,macOS需要麦克风和屏幕录制权限,Windows只需麦克风权限。