Qwen-Audio Realtime API 的服务端事件参考。所有服务端事件均包含 event_id (服务端自动生成)和 type (事件类型)公共字段。
用户指南:实时语音对话(Qwen-Audio-Realtime)。如需了解事件交互时序,请参见WebSocket API。
说明:请求错误或服务异常时返回。客户端错误(
说明:连接建立后服务端发送的首个事件,携带会话默认配置。
说明:收到
说明:VAD 检测到语音开始(server_vad / smart_turn 模式)。
说明:VAD 检测到语音结束(server_vad / smart_turn 模式)。
说明:音频缓冲已提交为用户消息(push-to-talk 的 commit 或 VAD 自动提交)。
说明:音频缓冲已清空(仅 push-to-talk 模式)。
说明:新的对话项创建成功。用户音频提交、客户端手动创建或助手响应开始时触发。
说明:对话项已删除。客户端发送
说明:查询对话项成功返回。客户端发送
说明:ASR 转写增量结果,在语音识别过程中流式返回。包含情绪和语种检测信息。
说明:ASR 转写最终结果。转写文本会写入对应 item 的
说明:ASR 转写失败。
说明:仅 smart_turn 模式。环境音频转写增量结果。当 VAD 检测到语音活动但语义判定为非有效轮次(如噪声、“嗯”、“啊”等无语义内容)时,将 ASR 识别结果以 ambient 事件透传给客户端。该事件不会关联到对话上下文中的任何 item,
说明:仅 smart_turn 模式。环境音频转写最终结果。与 delta 事件配对,表示一段环境音频的转写结束。该转写结果不会写入对话上下文。
说明:一轮模型推理开始。
说明:响应中新增一个输出项。普通回复的输出项类型为
说明:输出项中新增一个内容部分。
说明:纯文本模式下的文本增量事件,流式返回文本片段。
说明:纯文本模式下的文本输出完成事件。
说明:音频模式下的文字字幕增量事件,流式返回字幕片段。
说明:音频模式下的字幕输出完成事件。
说明:音频模式下的音频数据增量事件。
说明:音频模式下的音频输出完成事件,不包含音频数据。
说明:输出项中的内容部分输出完成。
说明:响应中的输出项输出完成。
说明:Function Calling 参数增量。模型决定调用工具时,服务端会先发送
说明:Function Calling 参数输出完成。收到该事件后,客户端应执行对应工具,并通过
说明:一轮推理完成。
说明:声纹注册流程异步进行中。
说明:声纹注册流程已完成。
说明:声纹注册失败,不阻塞正常对话调用。
error
说明:请求错误或服务异常时返回。客户端错误(invalid_request_error)不中断连接;服务端错误(server_error)将终止连接。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 error。errorobject错误的详细信息。
属性 type string错误类型,如 invalid_request_error(客户端错误)或 server_error(服务端错误)。codestring错误码。messagestring错误信息。paramstring与错误相关的参数。 |
session.created
说明:连接建立后服务端发送的首个事件,携带会话默认配置。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 session.created。sessionobject会话的配置信息。
属性 object string固定为 realtime.session。modelstring使用的模型名称。modalitiesarray模型输出模态设置。voicestring模型生成音频的音色,为系统音色名称或声音复刻音色的 voice_id。input_audio_transcriptionobject语音转录的配置。
属性 model string语音转录模型,如 fun-asr。object轮次检测(VAD)的配置。idstring会话唯一标识符。 |
session.updated
说明:收到 session.update 请求后,若处理成功,则返回此事件,携带更新后的完整会话配置;若出错,则返回 error 事件。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 session.updated。sessionobject更新后的完整会话配置信息。结构与 session.created 中的 session 对象一致。 |
input_audio_buffer.speech_started
说明:VAD 检测到语音开始(server_vad / smart_turn 模式)。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 input_audio_buffer.speech_started。audio_start_msinteger语音开始的时间戳(毫秒)。item_idstring该段语音最终提交时将创建的 item 的 ID。 |
input_audio_buffer.speech_stopped
说明:VAD 检测到语音结束(server_vad / smart_turn 模式)。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 input_audio_buffer.speech_stopped。audio_end_msinteger语音结束的时间戳(毫秒)。item_idstring将创建的用户消息项的 ID。reasonstring仅 smart_turn 模式返回此字段。取值为 turn_invalid 时表示当前 turn 被判定为无效轮(无语义内容),不会触发推理。有效轮次时不返回此字段。 |
input_audio_buffer.committed
说明:音频缓冲已提交为用户消息(push-to-talk 的 commit 或 VAD 自动提交)。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 input_audio_buffer.committed。previous_item_idstring前一条对话项的 ID。item_idstring创建的用户消息项的 ID。 |
input_audio_buffer.cleared
说明:音频缓冲已清空(仅 push-to-talk 模式)。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 input_audio_buffer.cleared。 |
conversation.item.created
说明:新的对话项创建成功。用户音频提交、客户端手动创建或助手响应开始时触发。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 conversation.item.created。previous_item_idstring前一条对话项的 ID。itemobject创建的对话项。
属性 id string对话项的唯一标识符。objectstring固定为 realtime.item。typestring对话项类型:message(普通消息)或 function_call(函数调用)。statusstring对话项状态,如 in_progress、completed。rolestring消息角色,如 user、assistant。仅 message 类型包含。contentarray消息内容列表。仅 message 类型包含。 |
conversation.item.deleted
说明:对话项已删除。客户端发送 conversation.item.delete 后返回此确认事件。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 conversation.item.deleted。item_idstring已删除的对话项 ID。 |
conversation.item.retrieved
说明:查询对话项成功返回。客户端发送 conversation.item.retrieve 后返回此事件。音频类型 content 仅包含转写文本,不返回原始音频数据。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 conversation.item.retrieved。itemobject查询到的对话项完整信息。
属性 id string对话项的唯一标识符。objectstring固定为 realtime.item。typestring对话项类型:message(普通消息)或 function_call(函数调用)。rolestring消息角色,如 user、assistant。仅 message 类型包含。contentarray消息内容列表。音频类型 content 仅包含转写文本,不返回原始音频数据。 |
conversation.item.input_audio_transcription.delta
说明:ASR 转写增量结果,在语音识别过程中流式返回。包含情绪和语种检测信息。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 conversation.item.input_audio_transcription.delta。item_idstring关联的对话项 ID。content_indexinteger内容部分的索引。textstring已确定的转写文本。stashstring尚未确定的暂存文本。 |
conversation.item.input_audio_transcription.completed
说明:ASR 转写最终结果。转写文本会写入对应 item 的 transcript 字段。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 conversation.item.input_audio_transcription.completed。item_idstring关联的对话项 ID。content_indexinteger内容部分的索引。transcriptstring完整的转写文本。 |
conversation.item.input_audio_transcription.failed
说明:ASR 转写失败。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 conversation.item.input_audio_transcription.failed。item_idstring关联的对话项 ID。content_indexinteger内容部分的索引。errorobject错误的详细信息。
属性 type string错误类型,如 transcription_error。codestring错误码,如 transcription_failed。messagestring错误信息。 |
conversation.item.ambient_audio_transcription.delta
说明:仅 smart_turn 模式。环境音频转写增量结果。当 VAD 检测到语音活动但语义判定为非有效轮次(如噪声、“嗯”、“啊”等无语义内容)时,将 ASR 识别结果以 ambient 事件透传给客户端。该事件不会关联到对话上下文中的任何 item,item_id 为独立生成的临时 ID。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 conversation.item.ambient_audio_transcription.delta。item_idstring独立生成的临时 ID,不关联到对话上下文中的任何 item。content_indexinteger内容部分的索引。textstring已确定的转写文本。stashstring尚未确定的暂存文本。 |
conversation.item.ambient_audio_transcription.completed
说明:仅 smart_turn 模式。环境音频转写最终结果。与 delta 事件配对,表示一段环境音频的转写结束。该转写结果不会写入对话上下文。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 conversation.item.ambient_audio_transcription.completed。item_idstring独立生成的临时 ID,不关联到对话上下文。content_indexinteger内容部分的索引。transcriptstring完整的转写文本。 |
response.created
说明:一轮模型推理开始。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.created。responseobject响应对象。
属性 id string响应的唯一标识符。objectstring固定为 realtime.response。statusstring响应状态,如 in_progress。modalitiesarray模型输出模态设置。voicestring模型生成音频的音色,为系统音色名称或声音复刻音色的 voice_id。outputarray响应的输出项列表,初始为空数组。 |
response.output_item.added
说明:响应中新增一个输出项。普通回复的输出项类型为 message;Function Calling 的输出项类型为 function_call。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.output_item.added。response_idstring关联的响应 ID。output_indexinteger输出项在响应中的索引。itemobject新增的输出项。
属性 id string输出项的唯一标识符。objectstring固定为 realtime.item。typestring输出项类型:message(普通消息)或 function_call(函数调用)。statusstring输出项状态,如 in_progress。rolestring消息角色,固定为 assistant。仅 message 类型包含。contentarray消息内容列表。仅 message 类型包含。 | response.output_item.added / conversation.item.created / response.output_item.done 中的 item 结构如下:一轮响应可包含多个 function_call,也可能同时包含普通 message 输出和 function_call 输出。Function Call 部分不会送入 TTS 播报。 |
response.content_part.added
说明:输出项中新增一个内容部分。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.content_part.added。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。content_indexinteger内容部分在输出项中的索引。partobject新增的内容部分。
属性 type string内容类型,如 audio、text。textstring文本内容,初始为空字符串。 |
response.text.delta
说明:纯文本模式下的文本增量事件,流式返回文本片段。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.text.delta。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。content_indexinteger内容部分在输出项中的索引。deltastring文本增量片段。 |
response.text.done
说明:纯文本模式下的文本输出完成事件。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.text.done。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。content_indexinteger内容部分在输出项中的索引。textstring完整的文本输出。 |
response.audio_transcript.delta
说明:音频模式下的文字字幕增量事件,流式返回字幕片段。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.audio_transcript.delta。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。content_indexinteger内容部分在输出项中的索引。deltastring字幕增量片段。 |
response.audio_transcript.done
说明:音频模式下的字幕输出完成事件。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.audio_transcript.done。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。content_indexinteger内容部分在输出项中的索引。transcriptstring完整的字幕文本。 |
response.audio.delta
说明:音频模式下的音频数据增量事件。delta 字段为 Base64 编码的 PCM 音频数据。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.audio.delta。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。content_indexinteger内容部分在输出项中的索引。deltastringBase64 编码的 PCM 音频数据片段。 |
response.audio.done
说明:音频模式下的音频输出完成事件,不包含音频数据。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.audio.done。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。content_indexinteger内容部分在输出项中的索引。 |
response.content_part.done
说明:输出项中的内容部分输出完成。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.content_part.done。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。content_indexinteger内容部分在输出项中的索引。partobject完成的内容部分。
属性 type string内容类型,如 audio、text。textstring文本内容或音频字幕文本。 |
response.output_item.done
说明:响应中的输出项输出完成。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.output_item.done。response_idstring关联的响应 ID。output_indexinteger输出项在响应中的索引。itemobject完成的输出项完整信息。
属性 id string输出项的唯一标识符。objectstring固定为 realtime.item。typestring输出项类型:message(普通消息)或 function_call(函数调用)。statusstring输出项状态,如 completed。rolestring消息角色,固定为 assistant。仅 message 类型包含。contentarray消息内容列表。仅 message 类型包含。 |
response.function_call_arguments.delta
说明:Function Calling 参数增量。模型决定调用工具时,服务端会先发送 response.output_item.added(item.type=function_call)和对应的 conversation.item.created,随后通过本事件流式输出参数片段。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.function_call_arguments.delta。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。call_idstring函数调用的唯一标识符。deltastring函数调用参数的增量片段(JSON 字符串片段)。 |
response.function_call_arguments.done
说明:Function Calling 参数输出完成。收到该事件后,客户端应执行对应工具,并通过 conversation.item.create 写入 function_call_output,随后发送 response.create 触发二轮推理。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.function_call_arguments.done。response_idstring关联的响应 ID。item_idstring关联的输出项 ID。output_indexinteger输出项在响应中的索引。call_idstring函数调用的唯一标识符。namestring调用的函数名称。argumentsstring完整的函数调用参数(JSON 字符串)。 |
response.done
说明:一轮推理完成。status 表示结束原因。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 response.done。responseobject完整的响应对象。
属性 id string响应的唯一标识符。objectstring固定为 realtime.response。statusstring响应的结束状态。可选值:
object状态详情,仅在 cancelled 或 failed 时存在。
属性 type string状态类型,如 cancelled。reasonstring取消原因:turn_detected(VAD 打断)或 client_cancelled(客户端取消)。array模型输出模态设置。voicestring模型生成音频的音色,为系统音色名称或声音复刻音色的 voice_id。outputarray响应的输出项列表,包含完整的 item 对象。usageobject本次响应的 Token 消耗信息。仅在 status 为 completed 时返回。
属性 total_tokens integer本次响应消耗的总 Token 数。input_tokensinteger输入 Token 数。output_tokensinteger输出 Token 数。input_tokens_detailsobject输入 Token 的分项详情,包含 text_tokens(文本 Token 数)和 audio_tokens(音频 Token 数,仅在使用音频模态时存在)。output_tokens_detailsobject输出 Token 的分项详情,包含 text_tokens(文本 Token 数)和 audio_tokens(音频 Token 数,仅在使用音频模态时存在)。pluginsobject(可选)插件使用计量信息。启用联网搜索(enable_search)时返回。
属性 search object联网搜索计量信息。
属性 count integer搜索次数。strategystring搜索策略。 |
voiceprint_audio_list.in_progress
说明:声纹注册流程异步进行中。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 voiceprint_audio_list.in_progress。item_idstring声纹注册任务的唯一标识符。 |
voiceprint_audio_list.completed
说明:声纹注册流程已完成。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 voiceprint_audio_list.completed。item_idstring声纹注册任务的唯一标识符。 |
voiceprint_audio_list.failed
说明:声纹注册失败,不阻塞正常对话调用。
event_idstring本次事件唯一标识符。typestring事件类型,固定为 voiceprint_audio_list.failed。item_idstring声纹注册任务的唯一标识符。reasonstring失败原因描述。 |