$ cd ../blog
Mar 18, 2026 12 分钟阅读成本指南
ByAlex Chen·OpenClaw Community
成本优化:$200 → $15/月
通过分层模型、本地推理、智能缓存和供应商轮替,将 API 成本削减 90% 的完整指南——不在关键环节牺牲质量。
普通高级用户每月烧 $60-200 的 API 成本。优化后的用户花不到 $15。差别不在功能——在架构。本指南告诉你确切怎么做。
3 层策略
第 1 层:模型分层
最大的节省杠杆。用对的模型做对的事。
| Task | Model | Cost | Save |
|---|---|---|---|
| 心跳和状态检查 | Gemini Flash / Haiku | ~$0.001/次 | 95% |
| 核心对话 | Sonnet 4 / GPT-4o Mini | ~$0.01/次 | 60% |
| 关键决策 | Opus 4.5 | ~$0.08/次 | 0% |
| 摘要和提取 | Ollama (本地) | $0 | 100% |
第 2 层:本地模型分流
不需要前沿智能的任务,用免费模型运行。
| Task | Model | Cost | Save |
|---|---|---|---|
| 记忆查询 | SQLite FTS5 (本地) | $0 | 100% |
| 短摘要 | Phi-3 via Ollama | $0 | 100% |
| 分类任务 | Gemma 2B via Ollama | $0 | 100% |
| 嵌入生成 | nomic-embed-text | $0 | 100% |
第 3 层:智能缓存和去重
不要为同样的答案付两次钱。
| Task | Model | Cost | Save |
|---|---|---|---|
| 相同查询 | 响应缓存 | $0 | 100% |
| 相似查询 | 语义缓存 | $0 | 80% |
| 心跳去重 | 跳过相同 | $0 | 90% |
| 上下文窗口裁剪 | 滑动窗口 | 可变 | 40% |
供应商成本对比(2026年3月)
| Provider | Input | Output | Best For |
|---|---|---|---|
| Anthropic Claude Opus 4.5 | $15/M | $75/M | 复杂推理、关键任务 |
| Anthropic Claude Sonnet 4 | $3/M | $15/M | 日常对话、核心代理逻辑 |
| Anthropic Claude Haiku 3.5 | $0.25/M | $1.25/M | 心跳、分类、路由 |
| OpenAI GPT-4o | $2.50/M | $10/M | Anthropic 限流时的备用 |
| OpenAI GPT-4o Mini | $0.15/M | $0.60/M | 预算心跳、简单任务 |
| Google Gemini Flash | $0.075/M | $0.30/M | 最便宜的云选项。心跳最佳 |
| Ollama (本地) | 免费 | 免费 | 摘要、嵌入、分类 |
配置示例
# config.yaml - 分层模型设置
providers:
heartbeat:
provider: google
model: gemini-2.0-flash
default:
provider: anthropic
model: claude-sonnet-4
critical:
provider: anthropic
model: claude-opus-4.5
local:
provider: ollama
model: phi3:mini
spending_limits:
daily_max: 5.00
alert_threshold: 0.80实际成本场景
轻度用户
轻量聊天、每日简报、2-3 个自动化
$25/月$5/月
Gemini Flash 心跳 + Ollama 本地 + Sonnet 对话
标准用户
活跃聊天、10+ 自动化、价格监控
$80/月$15/月
分层模型 + 语义缓存 + 上下文裁剪
高级用户
30+ 自动化、浏览、多频道
$200/月$40/月
完整分层 + 本地分流 + 激进缓存
成本护栏
按供应商设置每日消费限制——防止失控
在每日限额 80% 时启用消费告警
创建独立测试工作区,使用更低限额
每周审查按模型层级分类的成本明细
设置每轮对话的 Token 限制
永远不要用 Opus 做心跳——这是第一大成本错误
关键要点
模型分层占 80% 的节省
仅将心跳从 Opus 移至 Gemini Flash 就每月节省 $60+。
本地模型免费且有能力
Ollama 以零成本处理摘要、分类和嵌入。无需 API Key。
缓存随时间复利
语义缓存随使用模式可预测化而节省更多。第 3 个月比第 1 个月更便宜。
不要过早优化
先让系统正常运行,再优化。坏掉的便宜代理比能用的贵代理更差。