Skip to main content
模型部署

DTU 模型部署

独占吞吐DTU(Dedicated Throughput Unit)以独占部署方式为指定模型提供性能和吞吐保障,按输入/输出 TPM(Tokens Per Minute,每分钟 token 数)售卖。本文介绍 DTU 的功能、计费方式、使用流程与支持模型。

产品概述

DTU(Dedicated Throughput Unit,独占吞吐)以独占部署方式为指定模型提供性能和吞吐保障,按 Input/Output TPM 售卖,支持基础模型与自定义模型。DTU 提供全托管推理服务,底层独占 GPU 资源,由平台负责运维。 DTU 是模型单元(Model Unit,MU)的继任方案:在保留 MU 独占算力、资源隔离与可部署微调模型等能力的同时,将计量粒度由模型单元数量调整为输入/输出 TPM,提供更直接的吞吐保障。新购独占部署建议优先选择 DTU。
  • 独占 GPU 资源,推理环境与其他用户物理隔离。
  • 支持基础模型和自定义模型(百炼微调模型或用户上传模型)部署。
  • 按性能档位选购,平台负责底层运维,无需管理 GPU。
  • 不主动设 RPM/TPM 上限,流量受实际承载力限制。
通用模型部署流程详见模型部署文档预置吞吐

方案选型

百炼为推理调用提供多种容量与计费方案。DTU 适用于需要独占部署、微调模型部署、低延迟高并发或数据隔离的场景。各方案的对比如下表所示。 Token 按量和 PTU 部署详见模型部署

对比维度

DTU

PTU

Token 按量

PAI/灵骏

特点

独占算力 + 微调模型

吞吐保障 + 低延迟

弹性灵活、零门槛

自定义运行时

资源隔离

物理隔离

逻辑隔离

共享公池

物理隔离

微调模型

全参 + LoRA

不支持

LoRA

支持

自定义框架

不支持

不支持

不支持

支持

计费模式

TPM 额度 × 时长

TPM 额度 × 时长

Token 用量

GPU × 时长

计费说明

DTU 按输入 TPM 和输出 TPM 分别计费,采用预付费(按月)模式。各模型有固定的输入/输出基准 TPM(见下表),购买时需为基准 TPM 的整数倍。输入和输出各至少购买基准 TPM(1 倍),生产环境建议各购买 2 倍以上。 费用由后端根据模型、输入/输出 TPM、服务区域和购买时长计算。各模型的价格如下表所示,起售和扩容价格均为输入输出各 1 倍基准 TPM 的总价,微调模型的价格与对应基础模型相同,具体以控制台实际展示为准。
部署相同模型,规格性能排序为:Fast > Efficient > Standard
  • 华北-北京2

模型

规格

基准输入(TPM)

基准输出(TPM)

起售价格(元/月)

扩容价格(元/月)

deepseek-v4-flash

Standard

2,240,000

280,000

1,107,400

1,107,904

deepseek-v4-flash-0731

Fast

1,676,000

213,000

277,984

277,984

glm-5.2

Fast

1,004,000

120,000

1,895,260

1,895,260

glm-5.1

Standard

256,000

32,000

504,704

504,704

qwen3.5-122b-a10b

Standard

7,288,000

904,000

3,772,320

3,772,320

qwen3.5-27b

Standard

291,000

36,000

131,976

131,976

Efficient

2,432,000

304,000

411,616

411,616

qwen3.5-35b-a3b

Standard

656,000

82,000

109,962

109,962

qwen3.5-397b-a17b

Standard

896,000

112,000

1,107,904

1,107,904

qwen3.5-4b

Standard

1,072,000

134,000

109,478

109,478

qwen3.6-27b

Standard

273,000

34,000

49,118

49,118

qwen3.7-plus-2026-05-26

Fast

1192000

148000

483,956

483,956

各模型在标准工况下的性能参考数据如下表所示,以控制台实际展示为准。
以下性能参考数据均在缓存命中率为 0% 的条件下测得。实际使用中,随着缓存命中率提升,模型性能也会相应提高。

模型

规格

输入长度

输出长度

缓存命中率

首字延迟(ms)

每token延迟(ms)

deepseek-v4-flash

Standard

4,000

500

无缓存命中

651

19

deepseek-v4-flash-0731

Fast

16,000

2,000

无缓存命中

1,079

13

glm-5.2

Fast

16,000

2,000

无缓存命中

1,558

15

glm-5.1

Standard

4,000

500

无缓存命中

769

27

qwen3.5-122b-a10b

Standard

16,000

2,000

无缓存命中

568

8

qwen3.5-27b

Standard

4,000

500

无缓存命中

1,448

23

Efficient

4,000

500

无缓存命中

703

14

qwen3.5-35b-a3b

Standard

4,000

500

无缓存命中

471

10

qwen3.5-397b-a17b

Standard

4,000

500

无缓存命中

996

27

qwen3.5-4b

Standard

4,000

500

无缓存命中

552

6

qwen3.6-27b

Standard

4,000

500

无缓存命中

1,292

19

qwen3.7-plus-2026-05-26

Fast

16000

2000

无缓存命中

888

10

创建部署

使用 DTU 前需在控制台开通 DTU 功能并申请资源额度。开通后在百炼控制台模型部署页面选择目标模型,计费方式选择 DTU 即可创建部署。
DTU 部署暂不支持通过 API 创建与管理,请在百炼控制台完成开通、创建、扩缩容与续费等操作。
通用模型部署的基础流程详见模型部署文档 创建部署的表单字段如下表所示。

参数

说明

是否必填

取值说明

服务名称

部署服务的名称

自定义

模型

部署的目标模型

下拉选择

部署模版

部署架构

下拉选择,默认选第一个

付费类型

计费方式

预付费(按月)

输入吞吐额度

购买的输入 TPM 容量

基准输入 TPM 的整数倍(kTPM)

输出吞吐额度

购买的输出 TPM 容量

基准输出 TPM 的整数倍(kTPM)

购买时长

购买周期

1-12(整数,月)

自动续费

到期自动续费

开/关

单次续费时长

开启自动续费时必填

1-12(整数,月)

容量规划

DTU 按输入/输出 TPM 售卖,所购 TPM 即每分钟可处理的最大 token 量。容量规划的目标是:依据业务峰值 token 需求推算需购买的倍数,再通过压测验证实际可承载的并发与延迟是否达标。各模型的基准输入/输出 TPM 与标准工况性能参考见上方表格。 建议使用 evalscope 等压测工具,按真实业务场景(输入/输出长度、并发数、延迟要求)压测,再对照定价表确定购买倍数。

容量规划方法

  1. 梳理业务峰值指标:典型请求的输入/输出 token 长度、目标并发数,以及对首字延迟(TTFT)和每 token 生成延迟(TPOT)的要求。
  2. 估算峰值吞吐需求:峰值输入 TPM ≈ 并发数 × 单请求输入长度 ÷ 单请求处理时长(分钟);峰值输出 TPM ≈ 并发数 × 单请求输出长度 ÷ 单请求生成时长(分钟)。
  3. 计算购买倍数:输入倍数 = ⌈峰值输入 TPM ÷ 基准输入 TPM⌉,输出倍数 = ⌈峰值输出 TPM ÷ 基准输出 TPM⌉;DTU 输入与输出需同增同减,取两者较大值作为最终倍数。
  4. 压测验证:按计算倍数购买后,用 evalscope 在目标工况下复测,确认实际吞吐与延迟满足业务要求。若延迟偏高,可在 TPM 余量内提高并发以提升有效吞吐。
如对延迟要求不严格,可在不超过所购 TPM 上限的前提下,通过提高并发数提升实际吞吐量。 业务测算示例: 某模型基准输入 656K TPM、基准输出 82K TPM。经业务峰值梳理,峰值输入约 1,300K TPM、峰值输出约 160K TPM。计算倍数:输入 ⌈1300÷656⌉=2、输出 ⌈160÷82⌉=2,取较大值 2 倍,购买输入 1,312K TPM(656K×2)+ 输出 164K TPM(82K×2);随后用 evalscope 在峰值工况压测,确认延迟达标。若业务量翻倍,峰值输入约 2,600K、输出约 320K,则输入 ⌈2600÷656⌉=4、输出 ⌈320÷82⌉=4,需购买 4 倍:输入 2,624K TPM(656K×4)+ 输出 328K TPM(82K×4),并复测。 测算公式:
购买倍数 = max(⌈峰值输入 TPM ÷ 基准输入 TPM⌉, ⌈峰值输出 TPM ÷ 基准输出 TPM⌉)

部署管理与扩缩容

部署列表展示已购买的输入/输出 TPM 额度,详情页展示 TPM 容量详情。 扩缩容:在部署列表中点击「扩缩容」修改输入/输出 TPM 容量。扩容显示需补交金额,缩容显示预计退款金额。输入和输出需同增或同减,不能一增一减。仅运行中的部署可操作。 续费:预付费包月到期可续费,详情页续费按钮进入续费流程,支持自动续费开关与单次续费时长。

常见问题

DTU 部署和 Token 按量计费有什么区别? Token 按量计费在共享资源池上按 token 用量计费;DTU 为独占 GPU 资源,按输入/输出 TPM 计费,适合需要稳定吞吐和独占部署的场景。 DTU 部署支持哪些计费方式? 仅支持预付费(按月)计费。 如何查看已购 TPM 的使用情况? 在百炼控制台模型部署的部署列表和详情页可查看已购的输入/输出 TPM 额度,详见模型部署文档
Token Plan
模型体验
  • 3D模型生成
  • 音乐生成
模型调优
模型压缩目录节点
用量统计与性能监控
资产中心
服务支持