Claude 的提示词缓存
Claude 可以在 API 调用之间缓存经常使用的上下文,从而降低长提示词的成本和延迟。
更新:提示词缓存已在 Anthropic API 上正式可用。提示词缓存也已在 Amazon Bedrock 和 Google Cloud 的 Vertex AI 上以预览形式提供。(2024 年 12 月 17 日)提示词缓存允许开发者在 API 调用之间缓存经常使用的上下文,现在已经可用于 Anthropic API。借助提示词缓存,客户可以为 Claude 提供更多背景知识和示例输出,同时让长提示词的成本最高降低 90%,延迟最高降低 85%。提示词缓存今天已面向 Claude 3.5 Sonnet、Claude 3 Opus 和 Claude 3 Haiku 开放公开测试版。
什么时候使用提示词缓存
当你想先发送大量提示词上下文,然后在后续请求中反复引用这些信息时,提示词缓存会很有效,包括:
• 对话型 Agent:降低长对话的成本和延迟,尤其是带有长指令或上传文档的对话。
• 编码助手:把代码库摘要版本保留在提示词中,从而改进自动补全和代码库问答。
• 大型文档处理:把完整长篇材料(包括图片)放入提示词,而不会增加响应延迟。
• 详细指令集:共享大量指令、流程和示例,用来微调 Claude 的回答。开发者常常在提示词里放少量示例,但使用提示词缓存后,你可以加入几十个高质量、多样化输出示例,从而获得更好的效果。
• Agentic 搜索和工具调用:提升多轮工具调用和迭代修改场景的表现,因为这类场景中的每一步通常都需要一次新的 API 调用。
• 与书籍、论文、文档、播客转录稿和其他长内容对话:把完整文档嵌入提示词,让任何知识库都能“活起来”,用户可以直接向它提问。
早期客户已经在多种用例中看到提示词缓存带来的明显速度和成本改善:从放入完整知识库,到 100-shot 示例,再到把对话的每一轮都包含进提示词。
缓存提示词如何计费
缓存提示词的价格取决于你缓存了多少输入 token,以及使用这些内容的频率。写入缓存的价格比相应模型的基础输入 token 价格高 25%;使用已缓存内容则便宜得多,只需基础输入 token 价格的 10%。
• 我们迄今最智能的模型
• 200K 上下文窗口
• $3 / MTok
• $3.75 / MTok - 缓存写入
• $0.30 / MTok - 缓存读取
• $15 / MTok
• 适合复杂任务的强大模型
• $18.75 / MTok - 缓存写入
• $1.50 / MTok - 缓存读取
• $75 / MTok
• 最快、最具成本效益的模型
• $0.25 / MTok
• $0.30 / MTok - 缓存写入
• $0.03 / MTok - 缓存读取
• $1.25 / MTok
客户案例:Notion
Notion 正在把提示词缓存加入由 Claude 驱动的 Notion AI 功能。成本降低、速度提升后,Notion 能够优化内部运营,并为客户创造更高质量、响应更快的用户体验。
我们很期待使用提示词缓存,让 Notion AI 更快、更便宜,同时保持最先进的质量。
— Simon Last,Notion 联合创始人
开始使用
要在 Anthropic API 上开始使用提示词缓存公开测试版,请查看我们的文档和定价页面。