本文介绍 Qwen-Audio-3.0-ASR-Flash-Streaming/Fun-ASR-Realtime 实时语音识别服务中客户端通过 WebSocket 发送给服务端的客户端事件,包括 run-task(启动任务)、 continue-task(更新上下文)、 finish-task(结束任务)等指令的数据结构与字段含义。
用户指南:关于模型介绍和选型建议请参见语音识别。
事件交互流程:如需了解事件交互时序,请参见WebSocket API。
说明:启动语音识别任务,设置模型、音频格式、采样率等参数。
发送时机:建立 WebSocket 连接后立即发送。
响应事件:服务端返回
说明:在任务执行过程中更新对话上下文信息,用于辅助识别。
发送时机:任务运行中,需要更新对话上下文时发送。
说明:通知服务端音频发送完毕,请求结束任务。
发送时机:所有音频数据发送完毕后。
响应事件:服务端返回
run-task
说明:启动语音识别任务,设置模型、音频格式、采样率等参数。
发送时机:建立 WebSocket 连接后立即发送。
响应事件:服务端返回 task-started 事件后才能发送音频。
headerobject(必选)
属性 action string(必选)指令类型,固定为 run-task。task_idstring(必选)客户端生成的任务 ID(UUID 格式),用于关联后续事件。streamingstring(必选)固定为 duplex。object(必选)
属性 task_group string(必选)任务组,固定为 audio。taskstring(必选)任务类型,固定为 asr。functionstring(必选)功能类型。固定为recognition。modelstring(必选)指定模型名。支持Qwen-Audio-3.0-ASR-Flash-Streaming和Fun-ASR-Realtime系列模型,详情请参见支持的模型与地域。inputobject(必选)输入对象。不携带上下文时传入{}。
属性 context array(object)(可选)对话上下文,用于辅助识别、提升专有词汇的识别准确率。使用方法详见上下文增强。
属性 role string(必选)消息角色。取值范围:
array(object)(必选)消息内容列表。
属性 type string(必选)内容类型。取值范围:
string(必选)文本内容。当 type 为 input_text 时,填入前几轮用户语音的识别结果或领域相关的词表;当 type 为 text 时,填入前几轮大语言模型的回复内容。object(必选)语音识别参数。
属性 format string(必选)音频格式。取值范围:
integer(必选)采样率(Hz)。取值范围:8k模型仅支持 8000 Hz,其他模型支持任意采样率。vocabulary_idstring(可选)预编译热词列表 ID。需预先调用创建热词列表接口生成,识别时传入该 ID 即可使用列表中的热词。适用于词汇已知且相对稳定、需要跨请求复用同一词表的场景。使用方法请参见预编译热词。vocabularyobject(可选)即时热词。以键值对形式传入,键为热词文本(string),值为热词权重(integer),无需预先创建热词列表。权重取值范围为 [1, 5] 或 50:取 [1, 5] 时值越大模型越倾向输出该词;取 50 时为超级热词,召回率大幅提升,但超级热词数量最多不超过 50 个。适用于临时性、会话级别的热词优化。与预编译热词同时配置时,系统会合并两类热词;合并后超过 2000 个时,随机选择 2000 个使用。使用方法请参见即时热词。language_hintsarray[string](可选)待识别音频语种。无默认值,不设置时模型自动识别。对于 Qwen-Audio-3.0-ASR-Flash-Streaming 系列模型,最多支持设置 4 个值,即便设置超出 4 个,也仅前 4 个生效;对于 Fun-ASR-Realtime 系列模型,仅支持设置 1 个值,即便设置多个,也仅第一个生效。
点击查看支持的语言代码
boolean(可选)是否启用语义断句。默认值:false。
integer(可选)VAD 断句静音阈值(ms)。当一段语音后的静音时长超过该阈值时,系统会判定该句子已结束。当semantic_punctuation_enabled为true时,不作为sentence_end返回依据,但设置过小可能会影响识别效果。默认值:1300。取值范围:[200, 6000]。multi_threshold_mode_enabledboolean(可选)是否启用多阈值模式。启用后可防止 VAD 断句切割过长。默认值:false。heartbeatboolean(可选)是否启用心跳包。默认值:false。
float(可选)语音与噪音的判定阈值,用于调整语音活动检测(VAD)的灵敏度。取值范围:[-1.0, 1.0]。取值说明:
string(可选)指定在语音识别过程中需要处理的敏感词,并支持对不同敏感词设置不同的处理方式。详情请参见敏感词过滤。 |
continue-task
说明:在任务执行过程中更新对话上下文信息,用于辅助识别。
发送时机:任务运行中,需要更新对话上下文时发送。
headerobject(必选)
属性 action string(必选)指令类型,固定为 continue-task。task_idstring(必选)客户端生成的任务 ID(UUID 格式),需与run-task事件中的 task_id 保持一致。streamingstring(必选)固定为 duplex。object(必选)
属性 input object(必选)输入对象。
属性 context array(object)(可选)对话上下文,用于辅助识别、提升专有词汇的识别准确率。使用方法详见上下文增强。
属性 role string(必选)消息角色。取值范围:
array(object)(必选)消息内容列表。
属性 type string(必选)内容类型。取值范围:
string(必选)文本内容。当 type 为 input_text 时,填入前几轮用户语音的识别结果或领域相关的词表;当 type 为 text 时,填入前几轮大语言模型的回复内容。 |
finish-task
说明:通知服务端音频发送完毕,请求结束任务。
发送时机:所有音频数据发送完毕后。
响应事件:服务端返回 task-finished 事件。
headerobject(必选)
属性 action string(必选)指令类型,固定为 finish-task。task_idstring(必选)客户端生成的任务 ID(UUID 格式),需与run-task事件中的 task_id 保持一致。streamingstring(必选)固定为 duplex。object(必选)
属性 input object(必选)固定为{}。 |