AI & ML★ 4.7k
Whisper STT — ローカル音声テキスト変換
Whisperモデルでローカル音声テキスト変換。会議、ポッドキャスト、ボイスメモ — 100%オフライン。
オフライン文字起こしの威力
OpenAIのWhisperは、音声テキスト変換のゴールドスタンダードです。このMCPは完全にローカルで実行します—クラウドAPI不要、サブスク不要、データがマシンから外に出ることもありません。機密会議、医療メモ、法的録音に最適です。
- 99言語:Whisperは99言語の文字起こしと翻訳をサポート。
- 複数モデル:tiny(最速)→ large-v3(最高精度)。ハードウェアに応じて選択。
- 話者分離:複数話者の録音で誰が何を言ったかを識別。
- タイムスタンプ出力:単語レベルとセグメントレベルのタイムスタンプで正確なアライメント。
設定
"mcpServers": {
"whisper": {
"command": "npx",
"args": ["-y", "@mcp/whisper-server"],
"env": { "WHISPER_MODEL": "large-v3" }
}
}おすすめプロンプト
- 「meeting.mp3を文字起こしして、議論内容からアクションアイテムを作成して。」
- 「このポッドキャストのエピソードをテキストに変換して、要点をまとめて。」
- 「今日のボイスメモをすべて文字起こしして、デイリーノートに追加して。」
ハードウェア要件
| モデル | VRAM | 速度 | 精度 |
|---|---|---|---|
| tiny | 1 GB | 10倍リアルタイム | 良好 |
| base | 1.5 GB | 7倍リアルタイム | やや良 |
| medium | 5 GB | 2倍リアルタイム | 優秀 |
| large-v3 | 10 GB | 1倍リアルタイム | 最高 |
</ Add to your README
If you use this skill in your project, add the badge to your GitHub README:
[](https://clawdbot.space/en/skills/mcp-whisper-stt?ref=badge&utm_source=mcp-whisper-stt&utm_medium=readme&utm_campaign=skill-page)