Skip to main content
实时语音合成(Sambert)

Sambert客户端事件

用户指南:关于模型介绍和选型建议请参见语音合成
Sambert仅支持在北京地域使用。

run-task

说明:启动语音合成任务,设置模型、采样率等参数,并一次性发送待合成文本。 发送时机:建立 WebSocket 连接后立即发送。 响应事件:服务端返回 task-started 事件。
Sambert 不支持流式输入,待合成文本需要在 run-task 的 input.text 中一次性发送。不支持 continue-task 和 finish-task 指令。
headerobject(必选)

属性

actionstring(必选)指令类型,固定为 run-tasktask_idstring(必选)客户端生成的任务 ID(UUID 格式),用于关联后续事件。streamingstring(必选)固定为 out
payloadobject(必选)

属性

task_groupstring(必选)任务组,固定为 audiotaskstring(必选)任务类型,固定为 ttsfunctionstring(必选)功能类型,固定为 SpeechSynthesizermodelstring(必选)模型名称,如 sambert-zhichu-v1inputobject(必选)输入数据,包含 text 字段,直接传入待合成文本。textstring(必选)待合成文本。parametersobject(必选)语音合成参数。

属性

text_typestring(必选)固定为 PlainTextformatstring(可选)音频编码格式。取值范围:
  • pcm
  • wav(默认)
  • mp3
sample_rateinteger(可选)音频采样率(Hz)。取值范围:8000, 16000(默认), 22050, 24000。volumeinteger(可选)音量。默认值:50。取值范围:[0, 100]。ratefloat(可选)语速。默认值:1.0。取值范围:[0.5, 2.0]。pitchfloat(可选)音调。默认值:1.0。取值范围:[0.5, 2.0]。word_timestamp_enabledboolean(可选)是否开启字级别时间戳。默认值:false。适用范围:所有 Sambert 模型。phoneme_timestamp_enabledboolean(可选)是否开启音素级别时间戳。默认值:false。需要先开启 word_timestamp_enabled。
{
    "header": {
        "action": "run-task",
        "task_id": "2bf83b9a-baeb-4fda-8d9a-xxxxxxxxxxxx",
        "streaming": "out"
    },
    "payload": {
        "task_group": "audio",
        "task": "tts",
        "function": "SpeechSynthesizer",
        "model": "sambert-zhichu-v1",
        "parameters": {
            "text_type": "PlainText",
            "format": "wav",
            "sample_rate": 16000,
            "volume": 50,
            "rate": 1.0,
            "pitch": 1.0,
            "word_timestamp_enabled": true,
            "phoneme_timestamp_enabled": true
        },
        "input": {
            "text": "待合成文本"
        }
    }
}
文本生成
图像生成
视频生成
3D模型生成
音频
Realtime API
  • 概述
向量与排序
模型生产