Skip to main content
文本生成

文本生成-部署模型

将训练好的文本模型发布为在线 API 服务。

适用范围

部署模型

  • 华北2(北京)
POST https://dashscope.aliyuncs.com/api/v1/deployments
Windows CMD 请将$DASHSCOPE_API_KEY替换为%DASHSCOPE_API_KEY%,PowerShell请替换为 $env:DASHSCOPE_API_KEY

请求参数

请求头(Headers)
Content-Type string (必选)固定值:application/jsonAuthorization string (必选)API Key鉴权,格式为Bearer sk-xxxx
请求体(Request Body)
model_name string (必选)待部署的模型名称,对应我的模型中的模型 ID。也可通过创建训练任务接口的输出获取。plan string (必选)部署方案。可选值:
  • mu:按模型单元计费。
  • lora:LoRA 共享部署(按 Token 用量计费)。
  • ptu:按预置吞吐量计费。
deploy_spec string (条件必填)部署模板。当 planmu 时必须填写。样例:"deploy_spec": "MU1"可通过获取可部署模型列表接口返回的 template_id 字段获取。capacity integer (条件必填)部署使用的资源单元数量,需为 base_capacity 的整数倍。不同 deploy_spec 的取值约束不同,例如 MU2 必须为 8 的倍数,MU5 可填 1。billing_method string (条件必填)计费方式。当 planmu 时必须填写。当前支持 "POST_PAY"(后付费)。enable_thinking boolean (可选)planmu 时可设置。部分模型支持,可设置为 truefalsemax_context_length number (可选)planmu 时可设置。部分模型支持。样例:"max_context_length": 131072rpm_limit number (可选)planmu 时可设置。部分模型支持,requests per minute,每分钟请求数。tpm_limit number (可选)planmu 时可设置。部分模型支持,token per minute,每分钟 Token 使用量。ptu_capacity object (可选)planptu 时生效。如果不填写该参数,将默认按照 10,000 input_tpm1,000 output_tpm 进行设置。

ptu_capacity 属性

input_tpm number部署的模型每分钟支持的最大输入 Token 量。output_tpm number部署的模型每分钟支持的最大输出 Token 量。thinking_output_tpm number部分模型支持,部署的模型每分钟支持的预置思考最大输出 Token 量。
name string (可选)模型的控制台显示名称。如果不传该参数,将自动使用 model_name 的值作为部署名称。suffix string (可选)模型部署后,将生成新的模型名称,suffix 用于指定新模型名称的后缀,最大长度为8个字符且需全局唯一。每个模型在首次部署时,可以不指定后缀。如果需要对同一模型进行多次部署,则必须设置后缀以便于区分。
  • 按模型单元计费
  • 按Token用量计费
  • 按预置吞吐计费
选择按模型单元计费,计费模式为按模型单元的使用时长收费,适用于模型调优后的大规模推理业务,资源专属,性能和成本灵活可调。
执行以下部署命令后,即便您还没有调用模型,模型部署服务仍将在部署成功后开始计费。建议您先确认服务计费规则,再执行部署命令。
curl "https://dashscope.aliyuncs.com/api/v1/deployments" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
    "name": "my_qwen_plus",
    "model_name": "qwen-plus-2025-12-01",
    "plan": "mu",
    "deploy_spec": "MU1",
    "enable_thinking": true,
    "capacity": 4,
    "billing_method": "POST_PAY",
    "max_context_length": 10000,
    "rpm_limit": 500,
    "tpm_limit": 1000
}'

部署排障与性能调优

max-num-seqs 参数不可配置

百炼模型部署在按预置吞吐计费按模型单元计费两种计费方式下,吞吐、并发和生成速度均为平台预置,不支持直接调整 vLLM 内部的 max-num-seqs 等推理引擎参数,本接口的请求参数中也不存在该参数。 按模型单元计费方式下,可通过选择模型单元类型(对应请求参数 deploy_spec)和调整部署副本数(对应请求参数 capacity)间接控制吞吐能力。

部署模板与资源隔离

当前部署模板仅支持单机部署(单机部署-增强型通用推理),不支持多卡实例隔离。如需资源隔离,请使用按模型单元计费方式,该方式下算力资源为业务专属。

限流错误处理

当并发请求超出限流阈值时,接口返回 HTTP 429,错误码为 Throttling.RateQuota,错误信息为 Requests rate limit exceeded, please try again later。处理方式:
  • 按预置吞吐计费:调整 ptu_capacity 中的 input_tpmoutput_tpm(控制台对应 Input kTPMOutput kTPM),或降低请求频率。该方式下溢出策略可选自动溢出(切换为按量付费)或仅使用 PTU 容量(超出容量的请求直接返回 429)。
  • 按模型单元计费:调整 rpm_limittpm_limit,或降低请求频率。

上下文长度调优

按模型单元计费方式下可通过请求参数 max_context_length 配置最长上下文,取值范围 1~262144(实际上限取决于所部署模型的能力)。该参数限制单次请求的上下文规模,从而限制单请求的内存占用,可降低 OOM 风险。 处理大量图片任务时,请结合图片尺寸和单请求图片数量设置该参数。

响应参数

request_id string请求的唯一标识符。output object任务详情。

属性

deployed_model string部署模型的唯一标识。用于查询模型部署状态和调用模型。model_name string模型标识名。status string部署状态:
  • PENDING:正在创建部署任务。
  • UPDATING:正在更新部署任务。
  • RUNNING:部署任务正在运行,此时已部署的模型可以正常处理请求。
  • STOPPED:部署任务已经停止,此时的部署任务不会被计费。
  • DELETING:正在删除部署任务。
  • FAILED:部署任务创建或更新失败。
base_model string使用的基准模型。gmt_create string部署任务创建时间。gmt_modified string部署任务更新时间。workspace_id string阿里云百炼API Key所属的业务空间ID。请参见获取Workspace IDcharge_type string付费模式。post_paid表示后付费。creator string创建人的阿里云账号ID。modifier string修改人的阿里云账号ID。plan string部署方式。base_capacity number基础模型运行所需的最小资源单元数量。ready_capacity number已就绪并可立即处理请求的资源单元数量。model_unit_spec string模型单元规格。仅 planmu 时返回。enable_thinking boolean是否开启思考模式。仅 planmu 时返回。max_context_length number最大上下文长度限制。仅 planmu 时返回。rpm_limit number每分钟请求数。仅 planmu 时返回。tpm_limit number每分钟 Token 使用量。仅 planmu 时返回。ptu_capacity object预置吞吐量配置。仅 planptu 时返回。

ptu_capacity 属性

input_tpm number部署的模型每分钟支持的最大输入 Token 量。output_tpm number部署的模型每分钟支持的最大输出 Token 量。thinking_output_tpm number部分模型支持,部署的模型每分钟支持的预置思考最大输出 Token 量。
code string错误码。调用失败时返回。message string错误详情描述。调用失败时返回。
  • 成功响应示例
  • 错误响应示例
重点关注:output.deployed_model(部署模型的唯一标识)、output.status(部署状态)。
{
    "request_id": "f2ae64f7-83cc-410c-bc0b-840443f7eb86",
    "output": {
        "deployed_model": "qwen-plus-2025-12-01-mu-xxxx",
        "gmt_create": "2025-06-17T11:00:38.68",
        "gmt_modified": "2025-06-17T11:00:38.68",
        "status": "PENDING",
        "model_name": "qwen-plus-2025-12-01",
        "base_model": "qwen-plus",
        "model_unit_spec": "MU1",
        "enable_thinking": true,
        "max_context_length": 10000,
        "rpm_limit": 500,
        "tpm_limit": 1000,
        "base_capacity": 1,
        "ready_capacity": 0,
        "workspace_id": "llm-v71tlv3d***",
        "charge_type": "post_paid",
        "creator": "175805416***",
        "modifier": "175805416***",
        "plan": "mu"
    }
}

下一步

部署为异步操作,调用本接口后可通过查询和管理部署接口查询部署状态。