本文介绍 Qwen-ASR 模型的输入与输出参数。可通过OpenAI 兼容或DashScope协议调用 API。
用户指南:模型介绍和选型请参见非实时语音识别。
不同模型支持的接入方式不同,请根据下表选择正确的方式进行集成。
与OpenAI兼容模式或DashScope同步调用(均为一次请求、立即返回结果)不同,异步调用专为处理长音频文件或耗时较长的任务设计,该模式采用“提交-轮询”的两步式流程,避免了因长时间等待而导致的请求超时:
模型接入方式
不同模型支持的接入方式不同,请根据下表选择正确的方式进行集成。
模型 | 接入方式 |
|---|---|
千问3-ASR-Flash-Filetrans | 仅支持DashScope异步调用方式 |
千问3-ASR-Flash |
OpenAI 兼容
URL
- 华北2(北京)
- 新加坡
HTTP请求地址:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1/chat/completionsSDK调用配置的base_url:https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1调用时请将{WorkspaceId}替换为真实的Workspace ID。请求参数modelstring(必选)模型名称。仅适用于千问3-ASR-Flash模型。messagesarray(必选)消息列表。
消息类型 System Message object(可选)用于为语音识别提供上下文(Context),如背景文本和实体词表等参考信息,不支持设置模型角色等传统系统提示词。如果设置系统消息,请放在messages列表的第一位。
属性 role string(必选)固定为system。object(必选)用户发送给模型的消息。
属性 content array(必选)用户消息的内容。仅允许设置一组消息。
属性 string(必选)用户消息的角色,固定为user。object(可选)用来指定某些功能是否启用。
属性 language string(可选)无默认值若已知音频的语种,可通过该参数指定待识别语种,以提升识别准确率。只能指定一个语种。若音频语种不确定,或包含多种语种(例如中英日韩混合),请勿指定该参数。
取值范围
boolean(可选)默认值为false是否启用ITN(Inverse Text Normalization,逆文本标准化)。该功能仅适用于中文和英文音频。开启后,语音识别结果中的中文数字(如"一百二十三")或英文数字(如"one hundred")将自动转换为阿拉伯数字(如"123")。参数值:
boolean(可选)默认值为false是否以流式输出方式回复。相关文档:流式输出可选值:
true,可提升阅读体验并降低超时风险。stream_optionsobject(可选)流式输出的配置项,仅在 stream 为 true 时生效。
属性 include_usage boolean(可选)默认值为false是否在响应的最后一个数据块包含Token消耗信息。可选值:
流式输出时,Token 消耗信息仅可出现在响应的最后一个数据块。 |
|
响应参数idstring本次调用的唯一标识符。choicesarray模型的输出信息。
属性 finish_reason string有三种情况:
integer当前对象在choices数组中的索引。messageobject模型输出的消息对象。
属性 role string输出消息的角色,固定为assistant。contentarray语音识别结果。annotationsarray输出标注信息(如语种)
属性 language string被识别音频的语种。当请求参数language已指定语种时,该值与所指定的参数一致。
取值范围
string固定为audio_info,表示音频信息。emotionstring被识别音频的情感。支持的情感如下:
integer请求创建时的 Unix 时间戳(秒)。modelstring本次请求使用的模型。objectstring始终为chat.completion。usageobject本次请求的Token消耗信息。
属性 completion_tokens integer模型输出的 Token 数。completion_tokens_details object模型输出的 Token 细粒度详情。
属性 text_tokens integer模型输出文本的Token数。object输入的Token数。prompt_tokens_details object输入的 Token 细粒度详情。
属性 audio_tokens integer输入音频长度(Token)。音频转换Token规则:每秒音频转换为25个Token,不足1秒按1秒计算。text_tokens integer无需关注该参数。integer音频时长(秒)。total_tokens integer输入和输出总Token数(total_tokens = completion_tokens + prompt_tokens)。 |
DashScope同步调用
URL
- 华北2(北京)
- 新加坡
- 美国(弗吉尼亚)
HTTP请求地址:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generationSDK调用配置的base_url:https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1调用时请将{WorkspaceId}替换为真实的Workspace ID。请求参数modelstring(必选)模型名称。仅适用于千问3-ASR-Flash模型。messagesarray(必选)消息列表。通过HTTP调用时,请将messages放入 input 对象中。
消息类型 System Message object(可选)用于为语音识别提供上下文(Context),如背景文本和实体词表等参考信息,不支持设置模型角色等传统系统提示词。如果设置系统消息,请放在messages列表的第一位。仅千问3-ASR-Flash支持该参数。
属性 role string(必选)固定为system。object(必选)用户发送给模型的消息。object(可选)用来指定某些功能是否启用。仅千问3-ASR-Flash支持该参数。
属性 language string(可选)无默认值若已知音频的语种,可通过该参数指定待识别语种,以提升识别准确率。只能指定一个语种。若音频语种不确定,或包含多种语种(例如中英日韩混合),请勿指定该参数。
取值范围
boolean(可选)默认值为false是否启用ITN(Inverse Text Normalization,逆文本标准化)。该功能仅适用于中文和英文音频。开启后,语音识别结果中的中文数字(如"一百二十三")或英文数字(如"one hundred")将自动转换为阿拉伯数字(如"123")。参数值:
| 以下示例为音频 URL 识别;本地音频文件识别示例请参见快速开始。 |
响应参数request_idstring本次调用的唯一标识符。Java SDK返回参数为requestId。output object调用结果信息。
属性 choices array模型的输出信息。当result_format为message时返回choices参数。
属性 finish_reason string有三种情况:
object模型输出的消息对象。
属性 role string输出消息的角色,固定为assistant。contentarray输出消息的内容。
属性 text string语音识别结果。array输出标注信息(如语种)
属性 language string被识别音频的语种。当请求参数language已指定语种时,该值与所指定的参数一致。
取值范围
string固定为audio_info,表示音频信息。emotionstring被识别音频的情感。支持的情感如下:
object本次请求的Token消耗信息。
属性 input_tokens_details object千问3-ASR-Flash输入内容长度(Token)。
属性 text_tokens integer无需关注该参数。object千问3-ASR-Flash输出内容长度(Token)。
属性 text_tokens integer千问3-ASR-Flash输出的识别结果文本长度(Token)。integer千问3-ASR-Flash音频时长(秒)。 |
DashScope异步调用
流程说明
与OpenAI兼容模式或DashScope同步调用(均为一次请求、立即返回结果)不同,异步调用专为处理长音频文件或耗时较长的任务设计,该模式采用“提交-轮询”的两步式流程,避免了因长时间等待而导致的请求超时:
-
第一步:提交任务
- 客户端发起一个异步处理请求。
- 服务器验证请求后,不会立即执行任务,而是返回一个唯一的
task_id,表示任务已成功创建。
-
第二步:获取结果
- 客户端使用获取到的
task_id,通过轮询方式反复调用结果查询接口。 - 当任务处理完成后,结果查询接口将返回最终的识别结果。
- 客户端使用获取到的
-
使用 SDK(示例代码请参见快速开始,请求参数请参见提交任务的请求参数请求参数,返回结果请参见异步调用识别结果说明)
SDK封装了底层的API调用细节,提供了更便捷的编程体验。
- 提交任务:调用
async_call()(Python) 或asyncCall()(Java) 方法提交任务。此方法将返回一个包含task_id的任务对象。 - 获取结果:使用上一步返回的任务对象或
task_id,调用fetch()方法获取结果。SDK内部会自动处理轮询逻辑,直到任务完成或超时。
- 提交任务:调用
-
- 使用 RESTful API
提交任务
URL
- 华北2(北京)
- 新加坡
HTTP请求地址:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/asr/transcriptionSDK调用配置的base_url:https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1调用时请将{WorkspaceId}替换为真实的Workspace ID。请求参数modelstring(必选)模型名称。仅适用于千问3-ASR-Flash-Filetrans模型。inputobject(必选)
属性 object(可选)
属性 language string(可选)无默认值若已知音频的语种,可通过该参数指定待识别语种,以提升识别准确率。只能指定一个语种。若音频语种不确定,或包含多种语种(例如中英日韩混合),请勿指定该参数。
取值范围
boolean(可选)默认值为false是否启用ITN(Inverse Text Normalization,逆文本标准化)。该功能仅适用于中文和英文音频。开启后,语音识别结果中的中文数字(如"一百二十三")或英文数字(如"one hundred")将自动转换为阿拉伯数字(如"123")。参数值:
boolean(可选)默认值为false控制是否返回字级别时间戳:
array(可选)默认值为[0]指定在多音轨音频文件中需要识别的音轨索引,索引从 0 开始。例如,[0] 表示识别第一个音轨,[0, 1] 表示同时识别第一和第二个音轨。如果省略此参数,则默认处理第一个音轨。 |
|
响应参数request_idstring本次调用的唯一标识符。outputobject调用结果信息。
属性 task_id string任务ID。该ID在查询语音识别任务接口中作为请求参数传入。task_statusstring任务状态:
|
获取任务执行结果
URL
- 华北2(北京)
- 新加坡
HTTP请求地址:
GET https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id}SDK调用配置的base_url:https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1调用时请将{WorkspaceId}替换为真实的Workspace ID。请求参数task_idstring(必选)任务ID。将提交任务返回结果中的task_id作为参数传入,查询语音识别结果。 |
|
响应参数request_idstring本次调用的唯一标识符。outputobject调用结果信息。
属性 task_id string任务ID。该ID在查询语音识别任务接口中作为请求参数传入。task_statusstring任务状态:
object语音识别结果。
属性 transcription_url string识别结果文件的下载 URL,链接有效期为 24 小时。过期后无法查询任务,也无法通过先前的 URL 下载结果。识别结果以 JSON 文件保存,可通过该链接下载文件,或直接使用 HTTP 请求读取文件内容。 详情参见异步调用识别结果说明。 string任务提交时间。schedule_timestring任务调度时间,即开始执行时间。end_timestring任务结束时间。task_metricsobject任务指标,包含子任务状态的统计信息。
属性 TOTAL integer子任务总数。SUCCEEDEDinteger子任务成功数。FAILEDinteger子任务失败数。string错误码,仅在任务失败时返回。messagestring错误信息,仅任务失败时返回。usageobject本次请求的Token消耗信息。
属性 seconds integer千问3-ASR-Flash音频时长(秒)。 |
异步调用识别结果说明file_urlstring被识别的音频文件URL。audio_infoobject被识别音频文件相关信息。
属性 format string音频格式。sample_rate integer音频采样率。array完整的识别结果列表,每个元素对应一条音轨的识别内容。
属性 channel_id integer音轨索引,以0为起始。textstring识别结果文本。sentencesobject句子级别的识别结果列表。
属性 begin_time integer句子开始时间戳(毫秒)。end_timeinteger句子结束时间戳(毫秒)。textstring识别结果文本。sentence_idinteger句子索引,以0为起始。languagestring被识别音频的语种。当请求参数language已指定语种时,该值与所指定的参数一致。
取值范围
string被识别音频的情感。支持的情感如下:
object词级别的识别结果列表。当请求参数enable_words设为true时展示该结果。
属性 begin_time integer开始时间戳(毫秒)。end_timeinteger结束时间戳(毫秒)。textstring识别结果文本。punctuationstring标点符号。 |