支持的模型
模型名称 | 语音合成单价(每万字符) | 免费额度(注) | |
|---|---|---|---|
MiniMax/speech-2.8-hd | 3.5元 | 9.9元 (在首次使用复刻出来的音色进行语音合成的时候收取) | 无 |
MiniMax/speech-02-hd | 3.5元 | ||
MiniMax/speech-2.8-turbo | 2元 | ||
MiniMax/speech-02-turbo | 2元 |
URL
- 华北2(北京)
HTTP请求地址:
POST https://dashscope.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generationSDK调用配置的base_url:https://dashscope.aliyuncs.com/api/v1Headers
参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
Authorization | string | 是 | 鉴权令牌,格式为 |
Content-Type | string | 是 | 请求体的媒体类型,固定为 |
X-DashScope-SSE | string | 否 | 是否启用 SSE(Server-Sent Events)流式输出。设为 |
请求体modelstring(必选)模型名称。支持:
object(必选)
属性 text string(必选)待合成语音的文本。长度限制小于 10000 字符,若文本长度大于 3000 字符,推荐使用流式输出。stream_options object(可选)流式输出的配置项,仅在请求头 X-DashScope-SSE: enable 时生效。
属性 exclude_aggregated_audio boolean(可选) 默认值为false控制流式输出的合成结束帧中,audio 字段是否返回本次合成的完整音频(即此前所有合成中分块拼接后的整段 hex 数据)。取值范围:
该参数仅在流式输出场景下生效;非流式输出场景下设置无效。 object(必选)
属性 voice_id string(必选)设置音色ID。若需要设置混合音色,请设置 timbre_weights 参数,本参数设置为空值。speed float(可选) 默认值为1.0设置语速。取值范围:[0.5, 2.0]。vol float(可选) 默认值为1.0设置音量。取值范围:(0.0, 10.0]。pitch integer(可选) 默认值为0设置音高。取值范围:[-12, 12]。emotion string(可选) 无默认值设置情感。模型会根据输入文本自动匹配合适的情感,一般无需手动指定。取值范围:
speech-2.8-hd, speech-2.8-turbo 模型不支持 whisperboolean(可选) 默认值为false是否启用中文、英语文本规范化,开启后可提升数字阅读场景的性能,但会略微增加延迟。取值范围:
boolean(可选) 默认值为false是否启用朗读 LaTeX 公式的功能。取值范围:
$$x = \\frac{-b \\pm \\sqrt{b^2 - 4ac}}{2a}$$。
object(可选)
属性 sample_rate integer(可选) 默认值为32000设置生成的音频的采样率(单位为Hz)。取值范围:
integer(可选) 默认值为128000设置生成的音频的码率(单位kbps)。取值范围:
该参数仅在 format参数为mp3时生效。对于其他格式,该参数将被忽略。string(可选) 默认值为mp3设置生成的音频的格式。取值范围:
integer(可选) 默认值为1设置生成的音频的声道数。取值范围:
boolean(可选) 默认值为false是否以恒定码率进行音频编码。取值范围:
仅流式输出且音频格式为 mp3时该参数生效。object(可选)
属性 tone string[](可选)定义需要特殊标注的文字或符号对应的注音或发音替换规则。使用 / 作为分隔符。在中文文本中,声调用数字表示:一声为 1,二声为 2,三声为 3,四声为 4,轻声为 5。示例: ["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]object[](可选)若需要设置混合音色,请对该参数进行设置。最多支持 4 种音色混合。
属性 voice_id string(必选)设置音色ID。weight integer(必选)设置音色所占权重,必须与 voice_id 同步填写。单一音色取值占比越高,合成音色与该音色相似度越高。取值范围:[1, 100]。string(可选) 默认值为null是否增强对指定的小语种和方言的识别能力。可设置为 auto 让模型自主判断。
取值范围(点击查看):
object(可选)设置声音效果,该参数支持的音频格式:
属性 pitch integer(可选) 无默认值设置音高(低沉/明亮)。数值越低声音越低沉,数值越高声音越明亮。取值范围:[-100, 100]。intensity integer(可选) 无默认值设置强度(力量感/柔和)。数值越低声音越刚劲,数值越高声音越轻柔。取值范围:[-100, 100]。timbre integer(可选) 无默认值设置音色明暗程度(磁性/清脆)。数值越低声音越浑厚,数值越高声音越清脆。取值范围:[-100, 100]。sound_effects string(可选) 无默认值设置音效。取值范围:
boolean(可选) 默认值为false是否开启字幕。取值范围:
该参数仅在非流式输出场景下有效,且仅对 speech-2.8-hd, speech-2.8-turbo, speech-2.6-hd, speech-2.6-turbo, speech-02-hd, speech-02-turbo, speech-01-hd, speech-01-turbo 模型有效。string(可选) 默认值为hex设置输出结果形式。取值范围:
该参数仅在非流式场景中生效(流式场景只返回 hex形式)。boolean(可选) 默认值为false是否在合成音频末尾添加 AIGC 隐性标识。取值范围:
该参数仅在非流式输出场景下有效。 |
返回体request_idstring本次调用的唯一标识符。outputobject模型返回的数据。
属性 base_resp object本次请求的状态码和详情。
属性 status_code integer状态码。您可在header中获取本次会话的trace_id,用于在咨询/反馈时帮助定位问题
string状态详情。object返回的合成数据对象,可能为 null,需进行非空判断。
属性 atudio string合成后的音频数据,采用 hex 编码,格式与请求中(output_format参数)指定的输出格式一致。status integer当前音频流状态:1 表示合成中,2 表示合成结束object
属性 audio_length integer音频时长(毫秒)audio_sample_rateinteger音频采样率audio_sizeinteger音频文件大小(字节)bitrateinteger音频比特率audio_formatstring生成音频文件的格式。取值范围 [mp3, pcm, flac]可用选项: mp3, pcm, flac。audio_channel integer生成音频声道数,1:单声道,2:双声道invisible_character_ratio float非法字符占比.非法字符不超过 10%(包含 10%),音频会正常生成,并返回非法字符占比数据;如超过 10% 将进行报错usage_charactersinteger计费字符数word_countinteger已发音的字数统计,包含汉字、数字、字母,不包含标点符号string本次会话的 id,用于在咨询/反馈时帮助定位问题object本次请求的状态码和详情。
属性 atudio string合成后的音频数据,采用 hex 编码,格式与请求中(output_format参数)指定的输出格式一致。object本次请求的字符用量。
属性 characters integer输入文本的字符数。 |