将训练好的文本模型发布为在线 API 服务。
适用范围
- 适用地域:当前模型部署 API 仅在华北2(北京)地域开放。如您使用其他地域,请通过该地域的百炼控制台完成模型部署操作。
- 开通账号权限:若使用阿里云子账号(RAM用户),需要为子账号授予模型调用、训练和部署权限。
- 配置环境变量:已成功获取 API Key,并配置到环境变量。
- 阅读部署文档:建议先阅读模型部署概述和使用 API 创建模型部署任务,了解模型部署的使用方法和基本步骤。
部署模型
- 华北2(北京)
POST https://dashscope.aliyuncs.com/api/v1/deploymentsWindows CMD 请将$DASHSCOPE_API_KEY替换为%DASHSCOPE_API_KEY%,PowerShell请替换为$env:DASHSCOPE_API_KEY
请求参数请求头(Headers)Content-Typestring (必选)固定值:application/jsonAuthorization string (必选)API Key鉴权,格式为Bearer sk-xxxx。请求体(Request Body)model_namestring (必选)待部署的模型名称,对应我的模型中的模型 ID。也可通过创建训练任务接口的输出获取。plan string (必选)部署方案。可选值:
string (条件必填)部署模板。当 plan 为 mu 时必须填写。样例:"deploy_spec": "MU1"。可通过获取可部署模型列表接口返回的 template_id 字段获取。capacity integer (条件必填)部署使用的资源单元数量,需为 base_capacity 的整数倍。不同 deploy_spec 的取值约束不同,例如 MU2 必须为 8 的倍数,MU5 可填 1。billing_method string (条件必填)计费方式。当 plan 为 mu 时必须填写。当前支持 "POST_PAY"(后付费)。enable_thinking boolean (可选)仅 plan 为 mu 时可设置。部分模型支持,可设置为 true 或 false。max_context_length number (可选)仅 plan 为 mu 时可设置。部分模型支持。样例:"max_context_length": 131072。rpm_limit number (可选)仅 plan 为 mu 时可设置。部分模型支持,requests per minute,每分钟请求数。tpm_limit number (可选)仅 plan 为 mu 时可设置。部分模型支持,token per minute,每分钟 Token 使用量。ptu_capacity object (可选)仅 plan 为 ptu 时生效。如果不填写该参数,将默认按照 10,000 input_tpm 和 1,000 output_tpm 进行设置。
ptu_capacity 属性 input_tpm number部署的模型每分钟支持的最大输入 Token 量。output_tpm number部署的模型每分钟支持的最大输出 Token 量。thinking_output_tpm number部分模型支持,部署的模型每分钟支持的预置思考最大输出 Token 量。string (可选)模型的控制台显示名称。如果不传该参数,将自动使用 model_name 的值作为部署名称。suffix string (可选)模型部署后,将生成新的模型名称,suffix 用于指定新模型名称的后缀,最大长度为8个字符且需全局唯一。每个模型在首次部署时,可以不指定后缀。如果需要对同一模型进行多次部署,则必须设置后缀以便于区分。 |
选择按模型单元计费,计费模式为按模型单元的使用时长收费,适用于模型调优后的大规模推理业务,资源专属,性能和成本灵活可调。 执行以下部署命令后,即便您还没有调用模型,模型部署服务仍将在部署成功后开始计费。建议您先确认服务计费规则,再执行部署命令。 |
部署排障与性能调优
max-num-seqs 参数不可配置
百炼模型部署在按预置吞吐计费和按模型单元计费两种计费方式下,吞吐、并发和生成速度均为平台预置,不支持直接调整 vLLM 内部的 max-num-seqs 等推理引擎参数,本接口的请求参数中也不存在该参数。
按模型单元计费方式下,可通过选择模型单元类型(对应请求参数 deploy_spec)和调整部署副本数(对应请求参数 capacity)间接控制吞吐能力。
部署模板与资源隔离
当前部署模板仅支持单机部署(单机部署-增强型通用推理),不支持多卡实例隔离。如需资源隔离,请使用按模型单元计费方式,该方式下算力资源为业务专属。
限流错误处理
当并发请求超出限流阈值时,接口返回 HTTP 429,错误码为 Throttling.RateQuota,错误信息为 Requests rate limit exceeded, please try again later。处理方式:
- 按预置吞吐计费:调整
ptu_capacity中的input_tpm和output_tpm(控制台对应 Input kTPM 和 Output kTPM),或降低请求频率。该方式下溢出策略可选自动溢出(切换为按量付费)或仅使用 PTU 容量(超出容量的请求直接返回429)。 - 按模型单元计费:调整
rpm_limit和tpm_limit,或降低请求频率。
上下文长度调优
按模型单元计费方式下可通过请求参数 max_context_length 配置最长上下文,取值范围 1~262144(实际上限取决于所部署模型的能力)。该参数限制单次请求的上下文规模,从而限制单请求的内存占用,可降低 OOM 风险。
处理大量图片任务时,请结合图片尺寸和单请求图片数量设置该参数。
响应参数request_idstring请求的唯一标识符。output object任务详情。
属性 deployed_model string部署模型的唯一标识。用于查询模型部署状态和调用模型。model_name string模型标识名。status string部署状态:
string使用的基准模型。gmt_create string部署任务创建时间。gmt_modified string部署任务更新时间。workspace_id string阿里云百炼API Key所属的业务空间ID。请参见获取Workspace ID。charge_type string付费模式。post_paid表示后付费。creator string创建人的阿里云账号ID。modifier string修改人的阿里云账号ID。plan string部署方式。base_capacity number基础模型运行所需的最小资源单元数量。ready_capacity number已就绪并可立即处理请求的资源单元数量。model_unit_spec string模型单元规格。仅 plan 为 mu 时返回。enable_thinking boolean是否开启思考模式。仅 plan 为 mu 时返回。max_context_length number最大上下文长度限制。仅 plan 为 mu 时返回。rpm_limit number每分钟请求数。仅 plan 为 mu 时返回。tpm_limit number每分钟 Token 使用量。仅 plan 为 mu 时返回。ptu_capacity object预置吞吐量配置。仅 plan 为 ptu 时返回。
ptu_capacity 属性 input_tpm number部署的模型每分钟支持的最大输入 Token 量。output_tpm number部署的模型每分钟支持的最大输出 Token 量。thinking_output_tpm number部分模型支持,部署的模型每分钟支持的预置思考最大输出 Token 量。string错误码。调用失败时返回。message string错误详情描述。调用失败时返回。 |
重点关注: output.deployed_model(部署模型的唯一标识)、output.status(部署状态)。 |