Reachy Mini 实现完全本地化语音对话
Reachy Mini 现在可以完全本地运行语音对话了,不需要任何云服务或 API 密钥。跑本地的好处有三个:音频数据不出你的网络、没有任何 API 费用、可以自由替换 Pipeline 中的任何一个组件(VAD、STT、LLM、TTS)。这套系统用的是 Cascade 架构,即 VAD → STT → LLM → TTS 级联pipeline,通过 WebSocket /v1/realtime 接口暴露,和机器人原生协议完全兼容。
整篇文章给出了非常具体的部署方案。作者推荐 Silero VAD 做语音活动检测(CPU 就能跑,体积小精度高),Parakeet-TDT 做语音转文字(流式友好、速度快),Qwen3-TTS 做文字转语音(表达力强、低延迟、多语言)。LLM 层则提供了五种跑法:llama.cpp 本地服务、vLLM(支持投机解码和多 token 预测,显著降低延迟)、Hugging Face 托管端点、OpenAI 或任何兼容 Responses API 的外部服务、以及 Apple Silicon 上的 MLX。作者还特别提醒:关掉模型的 推理通道对实时对话至关重要,因为每个 thinking token 用户听到的都是静音。
实际部署只需几步:终端跑 llama-server 加载 Gemma-4 或 Qwen3-4B,再用一行命令启动 speech-to-speech,最后在机器人 App 里选 local 模式即可。vLLM 配置需要开启 –enable-auto-tool-choice、选对 –tool-call-parser、以及关闭 thinking 模式。跨机器使用时只需把 127.0.0.1 换成局域网 IP。整个方案完全模块化,新模型随时可换。


