本文介绍 Qwen-Audio-3.0-ASR-Flash-Streaming/Fun-ASR-Realtime 实时语音识别服务通过 WebSocket 推送给客户端的服务端事件,包括 task-started、result-generated、task-finished、task-failed 四类事件的数据结构与字段含义。
用户指南:关于模型介绍和选型建议请参见语音识别。
事件交互流程:如需了解事件交互时序,请参见WebSocket API。
说明:任务启动成功,客户端可开始发送音频数据。
说明:识别结果,包含中间结果(sentence_end=false)和最终结果(sentence_end=true)。其中,新句子的首个中间结果包含 sentence_begin=true。
说明:任务正常结束,可关闭连接或复用连接。
说明:任务失败,连接会被关闭,无法复用。
task-started
说明:任务启动成功,客户端可开始发送音频数据。
headerobject
属性 task_id string客户端生成的任务 ID(UUID 格式)。eventstring事件类型,固定为 task-started。attributesobject附加属性(通常为空)。object固定为{}。 |
result-generated
说明:识别结果,包含中间结果(sentence_end=false)和最终结果(sentence_end=true)。其中,新句子的首个中间结果包含 sentence_begin=true。
headerobject
属性 task_id string客户端生成的任务 ID(UUID 格式)。eventstring事件类型,固定为 result-generated。object
属性 output object
属性 usage object当payload.output.sentence.sentence_end为false(当前句子未结束)时,usage为null。当payload.output.sentence.sentence_end为true(当前句子已结束)时,usage.duration为当前任务计费时长。
属性 duration integer任务计费时长(s)。
属性 sentence object
属性 begin_time integer句子开始时间(ms)。end_timeinteger句子结束时间(ms)。textstring识别文本。heartbeatboolean若为 true,可跳过该结果(心跳包)。sentence_beginboolean用于标识句子开始。sentence_endboolean是否句子结束(true=最终结果,false=中间结果)。sentence_idinteger句子的序号标识。正常识别结果中,sentence_id 从 1 开始递增。当 heartbeat 为 true 时(即心跳包),sentence_id 固定为 0。wordsarray[object]字时间戳信息。
属性 begin_time integer字开始时间(ms)。end_timeinteger字结束时间(ms)。textstring识别文本。punctuationstring标点符号。 | 句子开始结果: |
task-finished
说明:任务正常结束,可关闭连接或复用连接。
headerobject
属性 task_id string客户端生成的任务 ID(UUID 格式)。eventstring事件类型,固定为 task-finished。attributesobject附加属性(通常为空)。object无需关注其中内容,通常为{}。 |
task-failed
说明:任务失败,连接会被关闭,无法复用。
headerobject
属性 task_id string客户端生成的任务 ID(UUID 格式)。eventstring事件类型,固定为 task-failed。error_codestring错误类型描述。error_messagestring具体错误原因。attributesobject附加属性(通常为空)。object固定为{}。 |