独占吞吐DTU(Dedicated Throughput Unit)以独占部署方式为指定模型提供性能和吞吐保障,按输入/输出 TPM(Tokens Per Minute,每分钟 token 数)售卖。本文介绍 DTU 的功能、计费方式、使用流程与支持模型。
产品概述
DTU(Dedicated Throughput Unit,独占吞吐)以独占部署方式为指定模型提供性能和吞吐保障,按 Input/Output TPM 售卖,支持基础模型与自定义模型。DTU 提供全托管推理服务,底层独占 GPU 资源,由平台负责运维。
DTU 是模型单元(Model Unit,MU)的继任方案:在保留 MU 独占算力、资源隔离与可部署微调模型等能力的同时,将计量粒度由模型单元数量调整为输入/输出 TPM,提供更直接的吞吐保障。新购独占部署建议优先选择 DTU。
- 独占 GPU 资源,推理环境与其他用户物理隔离。
- 支持基础模型和自定义模型(百炼微调模型或用户上传模型)部署。
- 按性能档位选购,平台负责底层运维,无需管理 GPU。
- 不主动设 RPM/TPM 上限,流量受实际承载力限制。
方案选型
百炼为推理调用提供多种容量与计费方案。DTU 适用于需要独占部署、微调模型部署、低延迟高并发或数据隔离的场景。各方案的对比如下表所示。
Token 按量和 PTU 部署详见模型部署。
对比维度 | DTU | PTU | Token 按量 | PAI/灵骏 |
|---|---|---|---|---|
特点 | 独占算力 + 微调模型 | 吞吐保障 + 低延迟 | 弹性灵活、零门槛 | 自定义运行时 |
资源隔离 | 物理隔离 | 逻辑隔离 | 共享公池 | 物理隔离 |
微调模型 | 全参 + LoRA | 不支持 | LoRA | 支持 |
自定义框架 | 不支持 | 不支持 | 不支持 | 支持 |
计费模式 | TPM 额度 × 时长 | TPM 额度 × 时长 | Token 用量 | GPU × 时长 |
计费说明
DTU 按输入 TPM 和输出 TPM 分别计费,采用预付费(按月)模式。各模型有固定的输入/输出基准 TPM(见下表),购买时需为基准 TPM 的整数倍。输入和输出各至少购买基准 TPM(1 倍),生产环境建议各购买 2 倍以上。
费用由后端根据模型、输入/输出 TPM、服务区域和购买时长计算。各模型的价格如下表所示,起售和扩容价格均为输入输出各 1 倍基准 TPM 的总价,微调模型的价格与对应基础模型相同,具体以控制台实际展示为准。
部署相同模型,规格性能排序为:Fast > Efficient > Standard。
- 华北-北京2
模型 | 规格 | 基准输入(TPM) | 基准输出(TPM) | 起售价格(元/月) | 扩容价格(元/月) |
|---|---|---|---|---|---|
deepseek-v4-flash | Standard | 2,240,000 | 280,000 | 1,107,400 | 1,107,904 |
deepseek-v4-flash-0731 | Fast | 1,676,000 | 213,000 | 277,984 | 277,984 |
glm-5.2 | Fast | 1,004,000 | 120,000 | 1,895,260 | 1,895,260 |
glm-5.1 | Standard | 256,000 | 32,000 | 504,704 | 504,704 |
qwen3.5-122b-a10b | Standard | 7,288,000 | 904,000 | 3,772,320 | 3,772,320 |
qwen3.5-27b | Standard | 291,000 | 36,000 | 131,976 | 131,976 |
Efficient | 2,432,000 | 304,000 | 411,616 | 411,616 | |
qwen3.5-35b-a3b | Standard | 656,000 | 82,000 | 109,962 | 109,962 |
qwen3.5-397b-a17b | Standard | 896,000 | 112,000 | 1,107,904 | 1,107,904 |
qwen3.5-4b | Standard | 1,072,000 | 134,000 | 109,478 | 109,478 |
qwen3.6-27b | Standard | 273,000 | 34,000 | 49,118 | 49,118 |
qwen3.7-plus-2026-05-26 | Fast | 1192000 | 148000 | 483,956 | 483,956 |
以下性能参考数据均在缓存命中率为 0% 的条件下测得。实际使用中,随着缓存命中率提升,模型性能也会相应提高。
模型 | 规格 | 输入长度 | 输出长度 | 缓存命中率 | 首字延迟(ms) | 每token延迟(ms) |
|---|---|---|---|---|---|---|
deepseek-v4-flash | Standard | 4,000 | 500 | 无缓存命中 | 651 | 19 |
deepseek-v4-flash-0731 | Fast | 16,000 | 2,000 | 无缓存命中 | 1,079 | 13 |
glm-5.2 | Fast | 16,000 | 2,000 | 无缓存命中 | 1,558 | 15 |
glm-5.1 | Standard | 4,000 | 500 | 无缓存命中 | 769 | 27 |
qwen3.5-122b-a10b | Standard | 16,000 | 2,000 | 无缓存命中 | 568 | 8 |
qwen3.5-27b | Standard | 4,000 | 500 | 无缓存命中 | 1,448 | 23 |
Efficient | 4,000 | 500 | 无缓存命中 | 703 | 14 | |
qwen3.5-35b-a3b | Standard | 4,000 | 500 | 无缓存命中 | 471 | 10 |
qwen3.5-397b-a17b | Standard | 4,000 | 500 | 无缓存命中 | 996 | 27 |
qwen3.5-4b | Standard | 4,000 | 500 | 无缓存命中 | 552 | 6 |
qwen3.6-27b | Standard | 4,000 | 500 | 无缓存命中 | 1,292 | 19 |
qwen3.7-plus-2026-05-26 | Fast | 16000 | 2000 | 无缓存命中 | 888 | 10 |
创建部署
使用 DTU 前需在控制台开通 DTU 功能并申请资源额度。开通后在百炼控制台模型部署页面选择目标模型,计费方式选择 DTU 即可创建部署。
通用模型部署的基础流程详见模型部署文档。
创建部署的表单字段如下表所示。
参数 | 说明 | 是否必填 | 取值说明 |
|---|---|---|---|
服务名称 | 部署服务的名称 | 是 | 自定义 |
模型 | 部署的目标模型 | 是 | 下拉选择 |
部署模版 | 部署架构 | 否 | 下拉选择,默认选第一个 |
付费类型 | 计费方式 | 是 | 预付费(按月) |
输入吞吐额度 | 购买的输入 TPM 容量 | 是 | 基准输入 TPM 的整数倍(kTPM) |
输出吞吐额度 | 购买的输出 TPM 容量 | 是 | 基准输出 TPM 的整数倍(kTPM) |
购买时长 | 购买周期 | 是 | 1-12(整数,月) |
自动续费 | 到期自动续费 | 否 | 开/关 |
单次续费时长 | 开启自动续费时必填 | 是 | 1-12(整数,月) |
容量规划
DTU 按输入/输出 TPM 售卖,所购 TPM 即每分钟可处理的最大 token 量。容量规划的目标是:依据业务峰值 token 需求推算需购买的倍数,再通过压测验证实际可承载的并发与延迟是否达标。各模型的基准输入/输出 TPM 与标准工况性能参考见上方表格。
建议使用 evalscope 等压测工具,按真实业务场景(输入/输出长度、并发数、延迟要求)压测,再对照定价表确定购买倍数。
容量规划方法
- 梳理业务峰值指标:典型请求的输入/输出 token 长度、目标并发数,以及对首字延迟(TTFT)和每 token 生成延迟(TPOT)的要求。
- 估算峰值吞吐需求:峰值输入 TPM ≈ 并发数 × 单请求输入长度 ÷ 单请求处理时长(分钟);峰值输出 TPM ≈ 并发数 × 单请求输出长度 ÷ 单请求生成时长(分钟)。
- 计算购买倍数:输入倍数 = ⌈峰值输入 TPM ÷ 基准输入 TPM⌉,输出倍数 = ⌈峰值输出 TPM ÷ 基准输出 TPM⌉;DTU 输入与输出需同增同减,取两者较大值作为最终倍数。
- 压测验证:按计算倍数购买后,用 evalscope 在目标工况下复测,确认实际吞吐与延迟满足业务要求。若延迟偏高,可在 TPM 余量内提高并发以提升有效吞吐。