本文介绍声音复刻的HTTP API接口详情,包括创建音色、查询音色列表、查询音色详情、更新音色和删除音色等操作。
用户指南:声音复刻。
HTTP请求地址:
音色创建后会经过审核流程,以下是各状态的含义。此状态体系仅适用于Qwen-Audio-TTS/CosyVoice(model为
接口地址(Qwen-Audio-TTS/CosyVoice/Qwen-TTS)
- 华北2(北京)
- 新加坡
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization调用时请将{WorkspaceId}替换为真实的Workspace ID。接口地址(MiniMax)
HTTP请求地址:POST https://dashscope.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
SDK调用配置的base_url:https://dashscope.aliyuncs.com/api/v1
第三方模型(MiniMax)目前仅支持通过dashscope.aliyuncs.com域名调用,暂不支持专属域名。
请求头
参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
Authorization | string | 是 | 鉴权令牌,格式为 |
Content-Type | string | 是 | 请求体的媒体类型。Qwen-Audio-TTS/CosyVoice/Qwen-TTS固定为 |
创建音色(Qwen-Audio-TTS/CosyVoice/Qwen-TTS)
请求体modelstring(必选)声音复刻模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。
string(必选)驱动音色的语音合成模型。必须与后续调用语音合成接口时使用的模型一致,否则合成会失败。url string(条件必选)用于复刻音色的音频文件URL,要求公网可访问。audio object(条件必选)音频数据,支持两种提交方式:
string(可选)音频对应的文本内容,用于辅助提升复刻效果。prefix string(条件必选)音色名称前缀,仅允许数字和英文字母,不超过10个字符。生成的音色名格式:{target_model}-{prefix}-{唯一标识}。preferred_name string(条件必选)音色名称前缀,仅允许数字、英文字母和下划线,不超过16个字符。language_hints array[string](可选)辅助模型识别样本音频的语种,从而更准确地提取音色特征,提升复刻效果。若设置的语种与实际音频语种不符(例如为中文音频设置 en),系统将忽略该设置并自动检测语种。此参数为数组,但当前版本仅处理第一个元素。取值范围(因模型而异):
string(可选)指定 audio.data 音频对应的语种。若使用该参数,设置的语种须与实际用于复刻的音频语种一致。取值范围:
float(可选)音频预处理后用于声音复刻的参考音频最大时长(秒)。取值范围:[3.0, 30.0]。默认值:10.0。enable_preprocess boolean(可选)是否开启音频预处理(降噪、音频增强、音量规整)。有背景噪音时建议开启;安静环境建议关闭以最大程度还原音色。默认值:false。enable_volume_normalization string(可选)是否对用于声音复刻的样本音频进行音量归一化。取值:
"false"。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice返回voice_id,Qwen返回voice。可直接用于语音合成接口的voice参数。target_modelstring驱动音色的语音合成模型。fallback_modeboolean是否以降级模式创建音色。当音频质量不佳或与文本不匹配时,该值为true,表示复刻效果可能不理想。fallback_reasonstring降级原因。可能的值包括no_merged_segments(无法合并音频片段)、no_valid_asr_segments(音频与文本严重不匹配)等。object本次请求用量信息。
属性 count integer创建的音色数量,固定为1。 |
创建音色(MiniMax)
音色复刻请求会生成一段试听音频,试听音频按所选模型的同步语音合成单价额外计费。
请求体modelstring(必选)指定合成试听音频使用的语音模型。支持的模型:
object(必选)
属性 action string(必选)需要进行的操作,支持设置为:voice_clone(声音克隆)audio_urlstring(必选)需要复刻的音频文件 URL,音频需符合以下规范:
object(可选)音色复刻示例音频,提供本参数将有助于增强语音合成的音色相似度和稳定性。若使用本参数,需准备一小段示例音频。
属性 prompt_audio string(可选)示例音频文件 URL,音频需符合以下规范:
string(可选)示例音频的对应文本,需确保和音频内容一致,句末需有标点符号做结尾。string(必选)复刻声音期望试听的内容。限制 1000 字符以内。试听将根据字符数正常收取语音合成费用,收费标准参见MiniMax模型价格。
string(必选)克隆音色的 voice_id,正确示例:"MiniMax001"。用户进行自定义 voice_id 时需注意:
该参数全局唯一,建议使用时间戳等个性化信息命名。language_boost enum<string>(可选)默认值:null是否增强对指定的小语种和方言的识别能力。可设置为 auto 让模型自主判断。
可用选项 Chinese, Chinese,Yue, English, Arabic, Russian, Spanish, French, Portuguese, German, Turkish, Dutch, Ukrainian, Vietnamese, Indonesian, Japanese, Italian, Korean, Thai, Polish, Romanian, Greek, Czech, Finnish, Hindi, Bulgarian, Danish, Hebrew, Malay, Persian, Slovak, Swedish, Croatian, Filipino, Hungarian, Norwegian, Slovenian, Catalan, Nynorsk, Tamil, Afrikaans,autoboolean (可选)默认值:false音频复刻参数,表示是否开启降噪,默认值为 false。need_volume_normalizationboolean (可选)默认值:false是否开启音量归一化。aigc_watermarkboolean (可选)默认值:false是否在合成试听音频的末尾添加音频节奏标识。 |
返回体request_idstring本次调用的唯一标识符。outputobject
属性 input_sensitive boolean输入音频是否命中风控。input_sensitive_typeinteger输入音频命中风控的类型,取值为以下其一:
string链接形式的试听音频。base_respobject
属性 status_code integer状态码
string状态详情object本次请求的字符用量。
属性 characters integer输入文本的字符数。 |
查询音色列表
请求体modelstring(必选)声音复刻模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。Qwen-Audio-TTS/CosyVoice:list_voice。Qwen:list。prefix string(可选)按前缀筛选音色。page_index integer(可选)页码索引。page_size integer(可选)每页包含数据条数。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 page_index integer当前页码索引。page_sizeinteger每页数据条数。total_countinteger音色总数。voice_listarray[object]查询到的音色列表。Qwen-Audio-TTS/CosyVoice和Qwen均使用voice_list字段名。
属性 voice_id / voice string音色ID。Qwen-Audio-TTS/CosyVoice为voice_id,Qwen为voice。gmt_createstring创建时间。gmt_modifiedstring修改时间。statusstring音色状态,取值参见"音色状态说明"。target_modelstring驱动音色的语音合成模型。object本次请求用量信息。
属性 count integerQwen-Audio-TTS/CosyVoice固定为1。Qwen固定为0。 |
查询音色详情
请求体modelstring(必选)固定为voice-enrollment(Qwen-Audio-TTS/CosyVoice)。inputobject(必选)输入参数对象。
属性 action string(必选)固定为query_voice。voice_id string(必选)要查询的音色ID。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。
|
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 resource_link string音频文件的URL地址。gmt_createstring创建时间。gmt_modifiedstring修改时间。statusstring音色状态,取值参见"音色状态说明"。target_modelstring驱动音色的语音合成模型。object本次请求用量信息。
属性 count integer固定为1。 |
更新音色
请求体modelstring(必选)固定为voice-enrollment。inputobject(必选)输入参数对象。
属性 action string(必选)固定为update_voice。voice_id string(必选)要更新的音色ID。url string(必选)新的音频文件URL,要求公网可访问。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据,更新操作返回空对象。usageobject本次请求用量信息。
属性 count integer固定为1。 |
删除音色
请求体modelstring(必选)声音复刻模型。取值:
object(必选)输入参数对象。
属性 action string(必选)操作类型。Qwen-Audio-TTS/CosyVoice:delete_voice。Qwen:delete。voice_id string(条件必选)要删除的音色ID。voice string(条件必选)要删除的音色名称。 | 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。Qwen-Audio-TTS/CosyVoice返回空对象,Qwen返回已删除的音色名称。
属性 voice string已删除的音色名称。object本次请求用量信息。
属性 count integer固定为1。 |
音色状态说明
音色创建后会经过审核流程,以下是各状态的含义。此状态体系仅适用于Qwen-Audio-TTS/CosyVoice(model为voice-enrollment时),Qwen的查询和列表返回中不包含status字段。
状态 | 说明 |
|---|---|
DEPLOYING | 审核中/处理中。 |
OK | 审核通过,可正常使用。 |
UNDEPLOYED | 审核未通过,不可使用。 |