本文介绍 Qwen-Audio-3.1-ASR-Flash-Message 实时语音识别服务通过 WebSocket 推送给客户端的服务端事件,包括 task-started、result-generated、task-finished、task-failed 四类事件的数据结构与字段含义。
task-started
任务启动成功,客户端可开始发送音频数据。
headerobject
属性 task_id string客户端生成的任务 ID(UUID 格式)。eventstring事件类型,固定为 task-started。attributesobject附加属性(通常为空)。object固定为{}。 |
result-generated
识别结果。默认返回句子最终识别文本(sentence_end=true);设置 intermediate_result_enabled=true 后还返回中间文本(sentence_end=false)。中间文本可能修订,应按 sentence_id 更新展示,不要直接拼接。句子开始事件可包含 sentence_begin=true,此时文本可能为空。
headerobject
属性 task_id string客户端生成的任务 ID(UUID 格式)。eventstring事件类型,固定为 result-generated。object
属性 output object
属性 sentence object
属性 begin_time integer句子开始时间(ms)。end_timeinteger句子结束时间(ms)。textstring识别文本。heartbeatboolean若为 true,可跳过该结果(心跳包)。sentence_beginboolean用于标识句子开始。sentence_endboolean是否句子结束(true=最终结果,false=中间结果)。sentence_idinteger句子的序号标识。正常识别结果中,sentence_id 从 1 开始递增。当 heartbeat 为 true 时(即心跳包),sentence_id 固定为 0。wordsarray[object]字时间戳信息。
属性 begin_time integer字开始时间(ms)。end_timeinteger字结束时间(ms)。textstring识别文本。punctuationstring标点符号。object当前任务截至本事件的累计用量。
属性 duration integer累计音频时长(秒),为兼容保留。input_tokensinteger累计输入 Token 数。output_tokensinteger累计输出 Token 数。total_tokensinteger累计 Token 总数,为 input_tokens 与 output_tokens 之和。 | 句子开始结果: |
task-finished
任务正常结束,可关闭连接或复用连接。
headerobject
属性 task_id string客户端生成的任务 ID(UUID 格式)。eventstring事件类型,固定为 task-finished。attributesobject附加属性(通常为空)。object包含 output(空对象)和 usage(本任务最终累计用量)。usage 字段定义与 result-generated 一致。 |
task-failed
任务失败,连接会被关闭,无法复用。
headerobject
属性 task_id string客户端生成的任务 ID(UUID 格式)。eventstring事件类型,固定为 task-failed。error_codestring错误类型描述。error_messagestring具体错误原因。attributesobject附加属性(通常为空)。object固定为{}。 |