Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

GPT-5.6 官方定价与缓存机制详解

API 定价中的缓存机制,是大规模部署时经常被低估的成本变量。GPT-5.6 的官方缓存规则包含两个关键参数:cache writes 的价格是标准输入价格的 1.25 倍,且每次缓存的最小生命周期为 30 分钟。 先看 cache writes 的 1.25 倍系数。这意味着写入缓存本身有溢价,如果后续读取命中率不高,缓存不仅不省钱,反而会增加成本。设想一个场景:系统提示很长,但每个用户对话只进行一次,缓存写入后没有后续命中,最终比不缓存多付 25%。 30 分钟的最小生命周期决定了哪些场景可以有效利用缓存。如果同一上下文前缀在 30 分钟内被多次调用,缓存就能产生正收益;如果请求频率低于这个阈值,缓存基本失效。这对 agent 编排层的设计有直接影响——如何复用上下文前缀、如何调度请求以提高缓存命中率,会成为成本优化的重要抓手。 对比这两个参数的组合效果,整体上倾向于鼓励"高复用长上下文"场景。批量文档处理、固定系统提示的客服类应用、长会话管理系统,这些场景的缓存收益会显著高于高频短对话场景。 Simon Willison 的梳理提供了一手解读,避免了从官方文档反向推算的歧义。对于正在接入 GPT-5.6 的工程团队,建议在上线前专门对缓存命中率做敏感性分析:在最坏情况(零命中率)和最优情况(高命中率)下分别建模成本,以便合理设置预算上限。 需要注意,这些参数可能随模型版本更新或企业合同条款而有所不同,实际接入时应以 OpenAI 官方 API 文档为准。