$cd ../use-cases/
⚡ 生産性高価値セットアップ15分
$ cat meeting-notes-generator.md
await transcribeMeeting(audio, { actionItems: true })
/** 通話を録音 → 60秒でアクションアイテム付き構造化ノートをSlackに送信。 */
リサは3タイムゾーンにまたがる20人のリモートチームを管理していた。毎週8件の会議後、ノートとアクションアイテムの整理に3時間以上かけていた。出来上がるのは長文ドキュメントで、チームの半分は読まず、残り半分はどの行動項目が「公式」かを議論する始末。完了率は40%止まり——怠惰なのではなく、割り当てが文章に埋もれて所有者が不明確だったから。 OpenClaw + Whisperを導入した後、会議後のワークフローは一変した。ZoomやGoogle Meetの録音ファイル(MP3またはWAV)を共有フォルダにドロップするだけ。OpenClawが自動検出し、ローカルWhisperで文字起こし(話者分離付き)を実行、言語モデルで構造化ノートを抽出。ファイル到着から60秒以内に、Slackチャンネルにフォーマット済みサマリーが届く。構成は3つ:主要決定事項(記録用)、アクションアイテム(@担当者と期限付き)、議論ポイント(検索可能な参照)。 リサの見積もりでは月12時間の節約。より重要なのはアクションアイテム完了率が85%に跳ね上がったこと。理由はシンプルで、Slackに「@bob: 3月10日までにAPI仕様を草稿」と表示されれば実行される。Googleドキュメントの4段落目に埋もれていれば忘れられる。
how_it_works.md
⚙️ 仕組み
1.
会議を録音(Zoom/Meet/電話)
Zoom内蔵レコーダー、Google Meet録音、スマートフォンアプリなど任意のレコーダーを使用。MP3/WAV/M4Aファイルを監視フォルダにドロップ。OpenClawが数秒以内に自動検出して処理を開始。手動トリガー不要。
2.
Whisperがローカルで文字起こし
OpenAIのWhisperモデルが完全にローカルハードウェアで実行——音声はクラウドAPIに送信されない。Whisper large-v3は英語95%+、日本語90%+の精度。話者ダイアライゼーションで誰が何を言ったかを特定し、アクションアイテムを正しい人に帰属。
3.
LLMがトランスクリプトを構造化
生のトランスクリプトが構造化抽出プロンプトと共に言語モデルに渡される。抽出される内容:3-5文のエグゼクティブサマリー、根拠付きの全決定事項、文脈から明確な担当者と期限を持つアクションアイテム、後の参照用の議論ポイント。
4.
Slack/Notion/メールに送信
完成したノートがチームの使用ツールに送られる——Slackチャンネル、Notionページ、参加者全員へのメール、またはWebhook経由で任意の送信先に。ローカルアーカイブに全会議が蓄積され、トピックや日付範囲で全文検索が可能。
example_note.md
📄 会議メモ例
# Q1 Planning Call — 2026-03-03
## Summary
Team aligned on product roadmap Q1. Prioritized mobile app and API expansion. Budget approved.
## Action Items
• @alice: Draft API spec by March 10
• @bob: Set up mobile dev environment
• @carol: Schedule design review
• @bob: Set up mobile dev environment
• @carol: Schedule design review
## Decisions
• Use React Native for mobile
• Launch beta April 1
• Launch beta April 1
❓ FAQ
Q1. Zoom/Google Meet/Teams対応?
はい。MP3、WAV、M4A形式の任意の音声ファイルを処理。Zoom内蔵レコーダー、Google Meet録音、Microsoft Teamsエクスポートなど任意のツールで録音し、監視フォルダにドロップするだけで自動処理が始まる。会議室ソフトウェアとの直接統合は不要。
Q2. 会議データは安全?
完全に安全。Whisperの文字起こしはローカルハードウェアで実行され、音声ファイルはサーバーから外に出ない。Ollamaを通じたローカルモデルを使えば、処理全体でデータ流出ゼロ。クラウドAPIを構造化に使う場合でも、音声ではなくテキストトランスクリプトのみが送信される。
Q3. 文字起こしの精度は?
Whisper large-v3は標準的な録音条件で英語95%+、日本語90%+の精度。強いアクセント、会話の重なり、音質が悪い場合は精度が低下する。製品名や技術略語などドメイン固有の用語にはカスタム語彙リストを追加して精度向上が可能。
Q4. 複数の話者を区別できる?
はい。話者ダイアライゼーション機能で各話者を識別(話者A、話者B等)し、文脈から名前が特定できる場合は名前に解決する。アクションアイテムは識別された話者に帰属されるので、最終ノートでの責任の所在が明確になる。
Q5. 処理にどれくらいかかる?
ローカルWhisperの文字起こしは約1倍のリアルタイム(60分会議でCPUなら約60分、GPUなら5-10分)。LLMによる構造化抽出に追加30-90秒。合計:CPUハードウェアで60-90分、GPUアクセラレーションやクラウドAPIで8-12分。