市販のスマートスピーカーは、リビングの音声を事業者に送信したうえで、本来家の外に出る必要のないコマンドの実行に2〜3秒かけます。この構成では、ウェイクワード・文字起こし・意図解析をすべてローカルのハードウェア上で処理し、往復を1秒未満に収めます。
市販のスマートスピーカーの問題点
ほとんどの「スマート」スピーカーは生の音声をクラウドに送信し、単純なローカルネットワークのコマンドを実行するだけで2〜3秒のラウンドトリップが発生します。さらに、文脈を理解しません。テレビを見ながら「それ消して」と言っても、Alexa は「それ」が何かわかりません。OpenClawならわかります。
1. エアギャップ・アーキテクチャ
私のセットアップはすべて、クローゼットに隠された Mac Mini M4 Pro で実行されています。OpenClawとHome Assistantを並行稼働させています。ネットワークはインターネットから物理的に完全に隔離されています(エアギャップ)。
2. ハードウェア・ノード
高価なEchoを買う代わりに、カスタムノードを自作しました:
- M5Stack Atom Echo ($13): 各部屋に配置されたESP32ベースの超小型スマートスピーカー。ウェイクワードで起動した音声をWi-Fi経由でストリーミングします。
- Mac Mini M4 Pro: 「頭脳」。音声文字起こし用のローカル Whisper、意図解析用の Llama 3、そして音声応答用の TTS(音声合成)を実行します。
- Home Assistant: 「筋肉」。OpenClaw は HA の推論 API に JSON RPC コマンドを直接送信し、リレーの切り替えを指示します。
3. 1秒未満の応答速度への到達
最大の壁は遅延(レイテンシ)でした。私はOpenClawの新しいStreaming Audio APIを使用しました。Atom Echoに向かって話すと、Whisperモデルがリアルタイムで文字起こしを行います。私が文を言い終わる頃には、LLMはすでに意図の解析を始めています。TTS音声が返事をする前に照明が切り替わります。
4. 「部屋を認識する」コンテキストアウェアネス
各 M5Stack は OpenClaw の設定で特定のゾーンに紐付けられているため、AIは私が「どこにいるか」を把握しています。寝室にいて「電気を消して」と言っても、キッチンの電気は消えません。空間認識能力も備わっています。
結果
結果として、ローカルのデバイス操作についてはクラウド型アシスタントより速く応答し、音声はLANの外に出ず、連続した指示も処理できるコントローラーが得られます。できないのは一般的な知識質問への回答です。これは家庭用コントローラーであって検索エンジンではありません。