重复的问题
聊天应用在每一轮都会重发系统提示、工具定义和对话历史。在一次典型会话中,这段静态前缀可能占你付费 token 的 80%。提示缓存让服务商跳过对这段前缀的重复处理,只按常规输入价格的一小部分收费。
缓存如何工作
当你发送请求时,服务商会检查你输入的开头是否与最近缓存的某段前缀匹配。若匹配,被缓存的部分按折扣的命中价计费,只有新增的后缀按全价处理。你稳定的前缀越长,节省越大。
什么更可能命中缓存
- 让系统提示和工具定义在各轮之间保持稳定。
- 把动态内容追加到消息末尾,而不是开头。
- 每次都按相同顺序发送完整历史,而不是从前端裁剪。
- 保持会话活跃以留在缓存存活期内,或在后续追问中复用同一会话。
缓存不能解决的问题
缓存降低的是每 token 的输入价格;它不改变输出定价,也不减少你生成的 token 数量。一个啰嗦作答的模型仍会花钱,所以缓存最好与简洁的系统提示和明确的输出约束搭配使用。
衡量差异
大多数网关会在用量对象里分别报告缓存命中与未命中的 token。启用缓存后,把一次多轮会话的计费输入与同样的会话在启用前做对比。维持冗长而稳定上下文的应用,输入成本通常能下降一半以上。
评论(166)