本文介绍 Paraformer 实时语音识别服务中客户端通过 WebSocket 发送给服务端的客户端事件,包括 run-task(启动任务)和 finish-task(结束任务)两类指令的数据结构与字段含义。
用户指南:关于模型介绍和选型建议请参见语音识别。
事件交互流程:如需了解事件交互时序,请参见WebSocket API。
说明:启动语音识别任务,设置模型、音频格式、采样率等参数。
发送时机:建立 WebSocket 连接后立即发送。
响应事件:服务端返回
说明:通知服务端音频发送完毕,请求结束任务。
发送时机:所有音频数据发送完毕后。
响应事件:服务端返回
run-task
说明:启动语音识别任务,设置模型、音频格式、采样率等参数。
发送时机:建立 WebSocket 连接后立即发送。
响应事件:服务端返回 task-started 事件后才能发送音频。
headerobject(必选)
属性 action string(必选)指令类型,固定为 run-task。task_idstring(必选)客户端生成的任务 ID(UUID 格式),用于关联后续事件。streamingstring(必选)固定为 duplex。object(必选)
属性 task_group string(必选)任务组,固定为 audio。taskstring(必选)任务类型,固定为 asr。functionstring(必选)功能类型。固定为recognition。modelstring(必选)模型名称。inputobject(必选)固定为{}。parametersobject(必选)语音识别参数。
属性 format string(必选)音频格式。取值范围:
integer(必选)采样率(Hz)。取值范围:
string(可选)热词列表 ID。disfluency_removal_enabledboolean(可选)是否过滤语气词。默认值:false。language_hintsarray[string](可选)待识别音频语种。无默认值,不设置时模型自动识别。取值范围:
boolean(可选)是否启用语义断句。默认值:false。
integer(可选)VAD 断句静音阈值(ms)。当一段语音后的静音时长超过该阈值时,系统会判定该句子已结束。默认值:1300。取值范围:[200, 6000]。multi_threshold_mode_enabledboolean(可选)是否启用多阈值模式。启用后可防止 VAD 断句切割过长。默认值:false。punctuation_prediction_enabledboolean(可选)是否在识别结果中添加标点符号。默认值:true。heartbeatboolean(可选)是否启用心跳包。默认值:false。
boolean(可选)是否启用逆文本正则化(ITN)。启用后,中文数字将转换为阿拉伯数字。默认值:true。 |
finish-task
说明:通知服务端音频发送完毕,请求结束任务。
发送时机:所有音频数据发送完毕后。
响应事件:服务端返回 task-finished 事件。
headerobject(必选)
属性 action string(必选)指令类型,固定为 finish-task。task_idstring(必选)客户端生成的任务 ID(UUID 格式),需与run-task事件中的 task_id 保持一致。streamingstring(必选)固定为 duplex。object(必选)
属性 input object(必选)固定为{}。 |