AI 缓存知识:如何大幅降低大模型使用成本
大模型缓存命中价格远低于未命中,本文解释缓存原理、各家缓存期限及保持缓存有效的技巧,帮助开发者和 AI 用户优化成本。
为什么大模型缓存命中这么便宜?
使用大模型时,费用主要来自输入和输出的 Token 数量。但细心的开发者会发现,在模型定价表中有一个“输入 Token 的缓存命中价格”,通常远低于未命中的输入价格。例如,DeepSeek V4 Flash 的缓存命中价格仅为 2 分钱,而未命中价格高达 1 元,相差 50 倍。这背后的原因是什么?我们能否利用缓存来降低使用成本?
输入收费的根源
大模型处理提示词时,需要将 Token 转换为向量,并计算所有 Token 之间的注意力关系。这一过程极其消耗算力,因此模型公司按输入 Token 收费。提示词越长,费用越高。
缓存的作用
在多轮对话或长任务中,每一轮都需要将之前的输入输出结果提交给模型。这些“前缀”内容在之前的轮次中已经计算过,完全可以缓存起来,下次直接复用,避免重复计算。这样既节省了算力,也加快了响应速度。缓存命中的费用实际上只是存储费用,因此非常便宜。
各家模型的缓存期限
缓存不会永久保存,如果一段时间未使用,服务器会删除缓存。根据测试,各家的缓存期限如下:
- Anthropic:5 分钟
- DeepSeek:10 分钟
- OpenAI:10 分钟到 30 分钟逐步失效
- Google:1 小时内逐步失效
以 DeepSeek 为例,若对话间隔超过 10 分钟,缓存被删除,下次输入将重新计算,费用从 2 分钱升至 1 元。
保持缓存有效的技巧
由于缓存命中与未命中价差巨大,AI Agent 工具通常会主动保持缓存活跃。常见做法是每隔 30 秒发送一次请求,但这样激活请求也会产生费用。例如,10 分钟内发送 20 个请求,成本不容忽视。
最新的建议是,将激活间隔改为 4 分钟,因为最短缓存期限也有 5 分钟,30 秒太频繁。此外,有些模型提供专门的缓存激活接口,若没有,可以重复发送一次之前的提示词来激活缓存。
实用建议
对于开发者和 AI 用户,合理利用缓存可以显著降低成本。在设计 Agent 时,应尽量控制对话间隔在缓存期限内,或采用合适的激活策略。对于非高频交互场景,可以适当延长激活间隔,平衡成本与缓存有效性。
科技动态简讯
- 带蓝牙识别的摄像头:美国创业公司推出可识别蓝牙设备 MAC 地址的交通摄像头,用于推断车内人员。
- 声波灭火:利用 30-60Hz 低频声波灭火,但体积和距离限制使其仅适用于零星火势。
- 无舷窗飞机:用液晶屏显示外部摄像头画面,减轻重量、降低油耗,但乘客可能失去真实视野。
- 最长视线:科学家确定从吉尔吉斯斯坦到中国昆仑山,距离 530 公里,得益于高海拔和通透空气。
工具与资源推荐
- Docker 沙箱:官方推出的容器沙箱,用于隔离 AI Agent 运行环境。
- CertMate:自搭建 SSL 证书管理,支持多家云服务商。
- trash-cli:Linux 命令行回收站,可恢复已删文件。
- MarkCard Studio:将 Markdown 转成分享卡片,支持 16 套主题。
- 乡音阁:文字转方言语音,支持 16 种方言。
- Insect 3D:60 种昆虫的 3D 图鉴,适合教育用途。
这些工具和资源能提升开发效率,尤其是 AI 缓存策略的优化,值得每个开发者实践。