$cd ../use-cases/
⚡ 生产力高价值15 分钟配置
$ cat meeting-notes-generator.md
await transcribeMeeting(audio, { actionItems: true })
/** 录制通话 → 60 秒内获得带行动项的结构化笔记并发送到 Slack。 */
小李管理一个跨 3 个时区的 20 人远程团队。每周开 8 场会,会后要花 3 个多小时手动整理笔记和行动项。结果是一大段文字让一半同事根本不看,另一半则会争论某个行动项的'官方'版本到底是什么。行动项完成率在 40% 左右徘徊——不是因为大家懒,而是任务被淹没在段落里,没有明确的负责人。 在一台 6 美元的 Hetzner VPS 上部署 OpenClaw + Whisper 之后,她的会后工作流变了样。将 Zoom 或 Google Meet 的录音文件(MP3 或 WAV)丢到共享文件夹,OpenClaw 自动检测到新文件,在本地运行 Whisper 转录(含说话人区分),再用语言模型提取结构化笔记。文件到达后 60 秒内,Slack 频道就会收到格式化摘要,包含三个部分:关键决策(留档用)、行动项(各有 @负责人 和截止日期)、讨论要点(可搜索的参考)。 小李估计每月节省了 12 小时。更重要的是,行动项完成率从 40% 跳到了 85%。原因很简单:'@bob: 3 月 10 日前起草 API 规范'出现在 Slack 里,就会被完成;埋在 Google 文档第 4 段里,就会被遗忘。
how_it_works.md
⚙️ 工作原理
1.
录制会议(Zoom/Meet/电话)
使用任何录音工具——Zoom 内置录制、Google Meet 录制、手机录音 App 或专用设备。将 MP3/WAV/M4A 文件拖入 OpenClaw 监控文件夹(可配置的本地目录)。OpenClaw 自动检测新文件并在几秒内开始处理,无需手动触发。
2.
Whisper 本地转录音频
OpenAI 的 Whisper 模型完全在本地硬件上运行,音频文件不会发送到任何云端 API。Whisper large-v3 在标准录音条件下英文精度 95%+,中文 90%+。说话人区分功能识别不同说话者,行动项可以自动归属到正确的人。
3.
LLM 结构化整理转录内容
原始转录稿通过结构化提取提示词传给语言模型(本地 Llama 或 Claude API)。它识别出:3-5 句话的执行摘要、所有决策及其依据、包含明确负责人和从上下文提取的截止日期的行动项,以及供后续参考的讨论要点。
4.
发送笔记到 Slack/Notion/邮件
完成的笔记发送到你的团队协作工具——Slack 频道、Notion 页面、发给所有与会者的邮件,或通过 Webhook 到任意目标。本地维护可搜索的存档,支持跨历史会议的全文检索,可以按主题或日期范围查询会议记录。
example_note.md
📄 会议记录示例
# Q1 Planning Call — 2026-03-03
## Summary
Team aligned on product roadmap Q1. Prioritized mobile app and API expansion. Budget approved.
## Action Items
• @alice: Draft API spec by March 10
• @bob: Set up mobile dev environment
• @carol: Schedule design review
• @bob: Set up mobile dev environment
• @carol: Schedule design review
## Decisions
• Use React Native for mobile
• Launch beta April 1
• Launch beta April 1
❓ FAQ
Q1. 支持 Zoom/Google Meet/Teams 吗?
支持。OpenClaw 处理 MP3、WAV 或 M4A 格式的任何音频文件。通过 Zoom 内置录制、Google Meet 录制、Microsoft Teams 导出或任何第三方工具录制,将文件拖入 OpenClaw 监控文件夹即可自动开始处理。不需要与会议室软件直接集成——只要能导出音频文件就行。
Q2. 会议数据私密吗?
完全私密。Whisper 转录在你的本地硬件上运行,音频文件不会离开你的服务器。转录步骤不使用任何云端 API。如果结构化提取也使用本地模型(通过 Ollama 的 Llama),整个处理过程中零数据外泄。即使结构化步骤使用云端 API,也只发送文本转录稿,不发送音频。
Q3. 转录准确率多高?
Whisper large-v3 在标准录音条件下英文 95%+,中文、日文等主要语言 90%+。重口音、交叉说话或录音质量差会降低准确率。可以为特定领域术语(产品名称、技术缩略词)添加自定义词汇表,以提高专业会议的准确率。
Q4. 能区分多个说话人吗?
能。OpenClaw 使用 Whisper 的说话人区分功能识别会议中的不同说话者,每个说话者被标记(说话人 A、说话人 B),在上下文允许的情况下(如有人说'我来处理,张三')会解析姓名。行动项归属到识别出的说话者,让最终笔记中的责任归属清晰明确。
Q5. 笔记格式是什么?
结构化 Markdown,含四个部分:摘要(3-5 句话)、关键决策(项目列表)、行动项(格式为'@负责人:任务——截止日期:日期')、讨论要点(可搜索参考)。笔记导出到 Slack(富文本)、Notion(页面)、邮件(HTML)或通过 Webhook 到任意服务。本地存档将所有笔记存储在可搜索的 SQLite 数据库中。
Q6. 处理需要多长时间?
本地 Whisper 转录大约需要 1 倍实时时长(1 小时会议在 CPU 上约 60 分钟,GPU 约 5-10 分钟)。LLM 结构化提取再需要 30-90 秒。总计:CPU 硬件上 1 小时会议约 60-90 分钟,GPU 加速或云端 API 约 8-12 分钟。