本文介绍声音设计的HTTP API接口详情,包括创建音色、查询音色列表、查询音色详情和删除音色四个操作。
用户指南:声音设计。
音色创建后会经过审核流程,以下是各状态的含义。此状态体系仅适用于Qwen-Audio-TTS/CosyVoice(model为
接口地址
- 华北2(北京)
- 新加坡
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization调用时请将{WorkspaceId}替换为真实的Workspace ID。请求头
参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
Authorization | string | 是 | 鉴权令牌,格式为 |
Content-Type | string | 是 | 请求体的媒体类型。固定为 |
创建音色
请求体modelstring(必选)声音设计模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。
string(必选)驱动音色的语音合成模型。必须与后续调用语音合成接口时使用的模型一致,否则合成会失败。voice_prompt string(必选)声音描述文本,仅支持中文和英文。
string(必选)预览音频对应的文本。
string(条件必选)音色名称前缀,仅允许数字和英文字母,不超过10个字符。生成的音色名格式:{target_model}-vd-{prefix}-{唯一标识}preferred_name string(条件必选)音色名称前缀,仅允许数字、英文字母和下划线,不超过16个字符。language_hints array[string](可选)指定生成音色的语言倾向,影响音色的语言特征和发音倾向,建议根据实际使用场景选择对应语言代码。若使用该参数,设置的语种须与 preview_text 的语种一致。此参数为数组,但当前版本仅处理第一个元素。取值范围:
string(可选)指定生成音色的语言倾向,影响音色的语言特征和发音倾向,建议根据实际使用场景选择对应语言代码。若使用该参数,设置的语种须与 preview_text 的语种一致。取值范围:
object(可选)声音设计的参数配置。
属性 sample_rate int(可选)预览音频采样率(Hz)。
string(可选)预览音频格式。
| 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice返回voice_id,Qwen返回voice。可直接用于语音合成接口的voice参数。preview_audioobject预览音频数据。
属性 data string预览音频数据,Base64编码。sample_rate int预览音频采样率(Hz)。response_format string预览音频格式。string驱动音色的语音合成模型。object本次请求用量信息。
属性 count integer创建的音色数量,固定为1。 |
查询音色列表
请求体modelstring(必选)声音设计模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。Qwen-Audio-TTS/CosyVoice:list_voice。Qwen:list。prefix string(可选)按前缀筛选音色。page_index integer(可选)页码索引。page_size integer(可选)每页包含数据条数。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 page_index integer当前页码索引。page_sizeinteger每页数据条数。total_countinteger音色总数。voice_listarray[object]查询到的音色列表。
属性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice为voice_id,Qwen为voice。gmt_createstring创建时间。gmt_modifiedstring修改时间。statusstring音色状态,取值参见"音色状态说明"。target_modelstring驱动音色的语音合成模型。languagestring音色语言。voice_promptstring声音描述文本。preview_textstring预览音频文本。object本次请求用量信息。
属性 count integerQwen-Audio-TTS/CosyVoice固定为1。Qwen固定为0。 |
查询音色详情
请求体modelstring(必选)声音设计模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。Qwen-Audio-TTS/CosyVoice:query_voice。Qwen声音设计:query。voice_id string(条件必选)要查询的音色ID。voice string(条件必选)要查询的音色名称。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice声音设计返回voice_id,Qwen声音设计返回voice。gmt_createstring创建时间。gmt_modifiedstring修改时间。statusstring音色状态,取值参见"音色状态说明"。target_modelstring驱动音色的语音合成模型。languagestring音色语言。voice_promptstring声音描述文本。preview_textstring预览音频文本。object本次请求用量信息。
属性 count integer固定为1。 |
删除音色
请求体modelstring(必选)声音设计模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。Qwen-Audio-TTS/CosyVoice:delete_voice。Qwen:delete。voice_id string(条件必选)要删除的音色ID。voice string(条件必选)要删除的音色名称。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。Qwen-Audio-TTS/CosyVoice返回空对象,Qwen返回已删除的音色名称。
属性 voice string已删除的音色名称。object本次请求用量信息。
属性 count integer固定为1。 |
音色状态说明
音色创建后会经过审核流程,以下是各状态的含义。此状态体系仅适用于Qwen-Audio-TTS/CosyVoice(model为voice-enrollment时),Qwen的查询和列表返回中不包含status字段。
状态 | 说明 |
|---|---|
DEPLOYING | 审核中/处理中。 |
OK | 审核通过,可正常使用。 |
UNDEPLOYED | 审核未通过,不可使用。 |