本文介绍 PTU(预置吞吐)部署的长输入和前缀缓存能力,包括额度消耗规则、 预置吞吐额度计算器 使用方法和 API 响应字段说明。
功能概述
PTU 部署支持长输入请求(部分模型最高 200K token)和前缀缓存,通过阶梯容量系数和缓存折扣灵活管理额度消耗。
核心能力:
- 长输入支持:部分模型支持超过 32K token 的输入,超出部分按更高的阶梯系数折算 TPM(每分钟 Token 数)消耗,详见额度消耗规则。
- 前缀缓存优惠:部分模型支持前缀缓存,命中缓存的输入 token 按折扣系数消耗额度(具体折扣率因模型而异),可降低多轮对话和重复前缀场景的额度消耗。
- 溢出策略:创建 PTU 时可选——自动溢出至按量计费(默认,业务不中断)或仅使用 PTU 容量(超出返回 429、不产生额外费用)。输入超过模型上限(千问 128K / DeepSeek 64K)仍自动转为按量计费。
额度消耗规则
长输入阶梯系数和缓存折扣按模型不同,以下为当前支持的模型参数:
模型 | 输入长度上限 | 缓存折扣 | 长输入阶梯系数 |
|---|---|---|---|
qwen3.8-Max | 1 Million | 0.125(缓存命中部分按 12.5% 折算容量) | 无阶梯(1.0) |
qwen3.7-plus-2026-05-26 | 1 Million | 0.2(缓存命中部分按 20% 折算容量) | 无阶梯(1.0) |
qwen3.7-flash-2026-07-15 | 1 Million | 0.2(缓存命中部分按 20% 折算容量) | [0, 32K):输入 1.0 / 输出 1.0 (256K, 1Million]:输入 6.0 / 输出 6.0 |
glm-5.2 | 1 Million | 0.25(缓存命中部分按 25% 折算容量) | 无阶梯(1.0) |
glm-5.1 | 200K | 0.2(缓存命中部分按 20% 折算容量) | [0, 32K):输入 1.0 / 输出 1.0 |
deepseek-v4-pro | 256K | 0.08(缓存命中部分按 8% 折算容量) | 无阶梯(1.0) |
deepseek-v4-flash-0731 | 1 Million | 0.2(缓存命中部分按 20% 折算容量) | 无阶梯(1.0) |
其他模型 | 以控制台为准 | 以控制台为准 | 无阶梯(1.0) |
计算示例(以 glm-5.1 为例)
使用预置吞吐额度计算器估算额度

参数 | 说明 | 对结果的影响 |
|---|---|---|
每分钟请求数(RPM) | 业务高峰期每分钟的请求数。 | RPM 越大,建议购买输入 KTPM 和输出 KTPM 同比增大。 |
平均输入长度(token) | 每条请求的平均输入 token 数。 | 输入越长,所处阶梯越高,系数越大,建议购买输入 KTPM 越高。不同模型的阶梯边界不同,以控制台实际展示为准。 |
平均输出长度(token) | 每条请求的平均输出 token 数。 | 输出越长,系数可能越大,建议购买输出 KTPM 越高。 |
缓存命中率(%) | 请求中重复前缀被缓存命中的比例。实际命中率取决于请求内容的重复程度,以运行结果为准。 | 命中率越高,输入容量消耗越慢,建议购买输入 KTPM 越低。仅影响输入 KTPM,不影响输出 KTPM。 |
API 响应字段说明
PTU 部署的 API 响应包含以下额度相关字段,用于标识计费方式和额度消耗:
字段 | 类型 | 说明 |
|---|---|---|
| String | 响应体顶层字段(所有 API 格式一致)。值为 |
| Integer | 折算后实际消耗的 PTU 额度 token 数(已含阶梯系数和缓存折扣) |
| Integer | 前缀缓存命中的 token 数,详见上下文缓存 |
- OpenAI Chat 兼容
- OpenAI Responses
- Anthropic 兼容
- DashScope
字段 | JSON 路径 | 说明 |
|---|---|---|
|
| 输入侧缓存命中数 |
|
| 输入侧 PTU 额度消耗 |
|
| 输出侧 PTU 额度消耗 |
监控与验证
PTU 部署的运行监控通过百炼平台的模型监控功能实现,支持查看以下与长输入和缓存相关的指标:
- PTU 利用率:输入/输出/思考模式输出三条独立曲线。长输入场景下阶梯系数会使利用率超过 100%,属于正常现象。
- Token 用量与缓存命中:包含
cached_tokens数据系列,可查看缓存命中量占总输入的比例。 - 配额内/外调用次数:了解超出 PTU 额度后的请求占比(自动溢出策略下转为按量计费,仅使用 PTU 容量策略下返回 429)。
常见问题
Q: 超出 PTU 额度时会怎样?
Q: 超出 PTU 额度时会怎样?
service_tier 字段不返回或返回 default,同时响应头包含 x-dashscope-ptu-overflow:true,业务不会中断;「仅使用 PTU 容量」策略下,超出请求返回 429 错误,不产生额外费用。Q: 单次输入超过模型上限时会怎样?
Q: 单次输入超过模型上限时会怎样?
Q: 如何确认缓存是否生效?
Q: 如何确认缓存是否生效?
cached_tokens 字段,值大于 0 表示前缀缓存命中。缓存命中部分按模型对应的折扣系数消耗额度(具体折扣率见额度消耗规则)。也可在控制台监控页面的 Token 用量图表中查看趋势。Q: cached_tokens 始终为 0,缓存未生效怎么办?
Q: cached_tokens 始终为 0,缓存未生效怎么办?
Q: 利用率为什么超过 100%?
Q: 利用率为什么超过 100%?