商用智能音箱会把你客厅的音频发给服务商,而且执行一条根本不需要出门的指令要花两三秒。这个方案把唤醒词、转录和意图解析全部留在本地硬件上,把整个往返压到一秒以内。
商业智能音箱的痛点
大多数「智能」音箱会把原始音频发到云端,为了执行一条只涉及局域网的指令要付出 2-3 秒往返延迟。它们同样缺乏空间语境:一台不知道自己在哪个房间的设备,无法解析「把它关掉」指的是什么。
1. 物理隔离架构
整套系统跑在网络机柜里的一台 Mac Mini M4 Pro 上,同时运行 OpenClaw 和 Home Assistant,所在 VLAN 没有通往公网的路由。
2. 硬件节点分布
卫星节点不用成品音箱,而是自制:
- M5Stack Atom Echo ($13): 放在每个房间的基于 ESP32 的微型智能音箱。它们通过 Wi-Fi 流式传输被唤醒词激活的音频流。
- Mac Mini M4 Pro: “大脑”。运行本地的 Whisper 模型进行语音转文字,Llama 3 进行意图解析,并运行 TTS 生成语音响应。
- Home Assistant: “肌肉”。OpenClaw 直接向 HA 推理 API 发送 JSON RPC 命令以控制继电器。
3. 突破亚秒级响应时间
延迟是这里最难的部分。OpenClaw 的流式音频 API 会在用户还在说话时就用 Whisper 边说边转录,等一句话说完,LLM 已经开始解析意图。灯往往在 TTS 开口回答之前就已经亮了。
4. “房间级”的场景感知
因为每个 M5Stack 卫星节点在 OpenClaw 配置里都绑定到一个区域,Agent 知道请求来自哪个房间。在卧室说「关灯」不会影响厨房——空间感知来自这个区域绑定。
最终成果
最终得到的是一个本地设备指令响应比云端助手更快、音频完全不出局域网、并且能处理连续指令的控制器。它做不到的是回答通用知识问题——它是家居控制器,不是搜索引擎。