Skip to main content
语音识别

非实时语音识别(Qwen-ASR)API参考

本文介绍 Qwen-ASR 模型的输入与输出参数。可通过OpenAI 兼容或DashScope协议调用 API。

用户指南:模型介绍和选型请参见非实时语音识别

模型接入方式

不同模型支持的接入方式不同,请根据下表选择正确的方式进行集成。

模型

接入方式

千问3-ASR-Flash-Filetrans

仅支持DashScope异步调用方式

千问3-ASR-Flash

OpenAI 兼容DashScope同步调用两种方式

OpenAI 兼容

美国地域不支持OpenAI兼容模式。

URL

  • 华北2(北京)
  • 新加坡
HTTP请求地址:POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1/chat/completionsSDK调用配置的base_url:https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1调用时请将{WorkspaceId}替换为真实的Workspace ID
阿里云百炼为华北2(北京)、新加坡地域推出了业务空间专属域名,能够为推理请求提供卓越的性能和更高的稳定性,建议迁移至新域名:
  • 华北2(北京)地域:从 dashscope.aliyuncs.com 迁移至 {WorkspaceId}.cn-beijing.maas.aliyuncs.com
  • 新加坡地域:从 dashscope-intl.aliyuncs.com 迁移至 {WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
{WorkspaceId}需要替换为真实的Workspace ID。现有域名仍可正常使用。

请求参数

modelstring(必选)模型名称。仅适用于千问3-ASR-Flash模型。messagesarray(必选)消息列表。

消息类型

System Messageobject(可选)用于为语音识别提供上下文(Context),如背景文本和实体词表等参考信息,不支持设置模型角色等传统系统提示词。如果设置系统消息,请放在messages列表的第一位。
rolestring(必选)固定为system
User Messageobject(必选)用户发送给模型的消息。
contentarray(必选)用户消息的内容。仅允许设置一组消息。

属性

typestring(必选)固定为input_audio,代表输入的是音频。input_audiostring(必选)待识别音频。具体用法请参见快速开始千问3-ASR-Flash模型在OpenAI兼容模式下支持两种输入形式:Base64编码的文件和公网可访问的待识别文件URL。使用SDK时,若录音文件存储在阿里云OSS,不支持使用以 oss://为前缀的临时 URL。使用RESTful API时,若录音文件存储在阿里云OSS,支持使用以 oss://为前缀的临时 URL。但需注意:
  • 临时 URL 有效期48小时,过期后无法使用,请勿用于生产环境。
  • 文件上传凭证接口限流为 100 QPS 且不支持扩容,请勿用于生产环境、高并发及压测场景。
  • 生产环境建议使用阿里云OSS 等稳定存储,确保文件长期可用并规避限流问题。
rolestring(必选)用户消息的角色,固定为user
asr_optionsobject(可选)用来指定某些功能是否启用。
asr_options非OpenAI标准参数,若使用OpenAI SDK,请通过extra_body传入。

属性

language string(可选)无默认值若已知音频的语种,可通过该参数指定待识别语种,以提升识别准确率。只能指定一个语种。若音频语种不确定,或包含多种语种(例如中英日韩混合),请勿指定该参数。
  • zh:中文(普通话、四川话、闽南语、吴语)
  • yue:粤语
  • en:英文
  • ja:日语
  • de:德语
  • ko:韩语
  • ru:俄语
  • fr:法语
  • pt:葡萄牙语
  • ar:阿拉伯语
  • it:意大利语
  • es:西班牙语
  • hi:印地语
  • id:印尼语
  • th:泰语
  • tr:土耳其语
  • uk:乌克兰语
  • vi:越南语
  • cs:捷克语
  • da:丹麦语
  • fil:菲律宾语
  • fi:芬兰语
  • is:冰岛语
  • ms:马来语
  • no:挪威语
  • pl:波兰语
  • sv:瑞典语
enable_itnboolean(可选)默认值为false是否启用ITN(Inverse Text Normalization,逆文本标准化)。该功能仅适用于中文和英文音频。开启后,语音识别结果中的中文数字(如"一百二十三")或英文数字(如"one hundred")将自动转换为阿拉伯数字(如"123")。参数值:
  • true:开启;
  • false:关闭。
streamboolean(可选)默认值为false是否以流式输出方式回复。相关文档:流式输出可选值:
  • false:模型生成全部内容后一次性返回;
  • true:边生成边输出,每生成一部分内容即返回一个数据块(chunk)。需实时逐个读取这些块以拼接完整回复。
推荐设置为true,可提升阅读体验并降低超时风险。stream_optionsobject(可选)流式输出的配置项,仅在 stream 为 true 时生效。

属性

include_usageboolean(可选)默认值为false是否在响应的最后一个数据块包含Token消耗信息。可选值:
  • true:包含;
  • false:不包含。
流式输出时,Token 消耗信息仅可出现在响应的最后一个数据块。
  • 输入内容:音频文件URL
  • 输入内容:Base64编码的音频文件
  • Python SDK
  • Node.js SDK
  • cURL
from openai import OpenAI
import os

try:
    client = OpenAI(
        # 新加坡和北京地域的API Key不同。获取API Key:https://help.aliyun.com/zh/model-studio/get-api-key
        # 若没有配置环境变量,请用阿里云百炼API Key将下行替换为:api_key = "sk-xxx",
        api_key=os.getenv("DASHSCOPE_API_KEY"),
        # 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。
        base_url="https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1",
    )

    stream_enabled = False  # 是否开启流式输出
    completion = client.chat.completions.create(
        model="qwen3-asr-flash",
        messages=[
            {
                "content": [
                    {
                        "type": "input_audio",
                        "input_audio": {
                            "data": "{YOUR_AUDIO_URL}"
                        }
                    }
                ],
                "role": "user"
            }
        ],
        stream=stream_enabled,
        # stream设为False时,不能设置stream_options参数
        # stream_options={"include_usage": True},
        extra_body={
            "asr_options": {
                # "language": "zh",
                "enable_itn": False
            }
        }
    )
    if stream_enabled:
        full_content = ""
        print("流式输出内容为:")
        for chunk in completion:
            # 如果stream_options.include_usage为True,则最后一个chunk的choices字段为空列表,需要跳过(可以通过chunk.usage获取 Token 使用量)
            print(chunk)
            if chunk.choices and chunk.choices[0].delta.content:
                full_content += chunk.choices[0].delta.content
        print(f"完整内容为:{full_content}")
    else:
        print(f"非流式输出内容为:{completion.choices[0].message.content}")
except Exception as e:
    print(f"错误信息:{e}")

响应参数

idstring本次调用的唯一标识符。choicesarray模型的输出信息。
finish_reasonstring有三种情况:
  • 正在生成时为null;
  • 因模型输出自然结束,或触发输入参数中的stop条件而结束时为stop;
  • 因生成长度过长而结束为length。
indexinteger当前对象在choices数组中的索引。messageobject模型输出的消息对象。

属性

rolestring输出消息的角色,固定为assistant。contentarray语音识别结果。annotationsarray输出标注信息(如语种)

属性

languagestring被识别音频的语种。当请求参数language已指定语种时,该值与所指定的参数一致。
  • zh:中文(普通话、四川话、闽南语、吴语)
  • yue:粤语
  • en:英文
  • ja:日语
  • de:德语
  • ko:韩语
  • ru:俄语
  • fr:法语
  • pt:葡萄牙语
  • ar:阿拉伯语
  • it:意大利语
  • es:西班牙语
  • hi:印地语
  • id:印尼语
  • th:泰语
  • tr:土耳其语
  • uk:乌克兰语
  • vi:越南语
  • cs:捷克语
  • da:丹麦语
  • fil:菲律宾语
  • fi:芬兰语
  • is:冰岛语
  • ms:马来语
  • no:挪威语
  • pl:波兰语
  • sv:瑞典语
typestring固定为audio_info,表示音频信息。emotionstring被识别音频的情感。支持的情感如下:
  • surprised:惊讶
  • neutral:平静
  • happy:愉快
  • sad:悲伤
  • disgusted:厌恶
  • angry:愤怒
  • fearful:恐惧
createdinteger请求创建时的 Unix 时间戳(秒)。modelstring本次请求使用的模型。objectstring始终为chat.completionusageobject本次请求的Token消耗信息。

属性

completion_tokens integer模型输出的 Token 数。completion_tokens_details object模型输出的 Token 细粒度详情。
text_tokens integer模型输出文本的Token数。
prompt_tokens object输入的Token数。prompt_tokens_details object输入的 Token 细粒度详情。
audio_tokens integer输入音频长度(Token)。音频转换Token规则:每秒音频转换为25个Token,不足1秒按1秒计算。text_tokens integer无需关注该参数。
seconds integer音频时长(秒)。total_tokens integer输入和输出总Token数(total_tokens = completion_tokens + prompt_tokens)。
{
    "choices": [
        {
            "finish_reason": "stop",
            "index": 0,
            "message": {
                "annotations": [
                    {
                        "emotion": "neutral",
                        "language": "zh",
                        "type": "audio_info"
                    }
                ],
                "content": "欢迎使用阿里云。",
                "role": "assistant"
            }
        }
    ],
    "created": 1767683986,
    "id": "chatcmpl-487abe5f-d4f2-9363-a877-xxxxxxx",
    "model": "qwen3-asr-flash",
    "object": "chat.completion",
    "usage": {
        "completion_tokens": 12,
        "completion_tokens_details": {
            "text_tokens": 12
        },
        "prompt_tokens": 42,
        "prompt_tokens_details": {
            "audio_tokens": 42,
            "text_tokens": 0
        },
        "seconds": 1,
        "total_tokens": 54
    }
}

DashScope同步调用

URL

  • 华北2(北京)
  • 新加坡
  • 美国(弗吉尼亚)
HTTP请求地址:POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generationSDK调用配置的base_url:https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1调用时请将{WorkspaceId}替换为真实的Workspace ID
阿里云百炼为华北2(北京)、新加坡地域推出了业务空间专属域名,能够为推理请求提供卓越的性能和更高的稳定性,建议迁移至新域名:
  • 华北2(北京)地域:从 dashscope.aliyuncs.com 迁移至 {WorkspaceId}.cn-beijing.maas.aliyuncs.com
  • 新加坡地域:从 dashscope-intl.aliyuncs.com 迁移至 {WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
{WorkspaceId}需要替换为真实的Workspace ID。现有域名仍可正常使用。

请求参数

modelstring(必选)模型名称。仅适用于千问3-ASR-Flash模型。messagesarray(必选)消息列表。
通过HTTP调用时,请将messages放入 input 对象中。

消息类型

System Messageobject(可选)用于为语音识别提供上下文(Context),如背景文本和实体词表等参考信息,不支持设置模型角色等传统系统提示词。如果设置系统消息,请放在messages列表的第一位。仅千问3-ASR-Flash支持该参数。
rolestring(必选)固定为system
User Messageobject(必选)用户发送给模型的消息。
contentarray(必选)用户消息的内容。仅允许设置一组消息。

属性

audiostring(必选)待识别音频。具体用法请参见快速开始千问3-ASR-Flash模型在DashScope调用方式下支持三种输入形式:Base64编码的文件、本地文件绝对路径、公网可访问的待识别文件URL。使用SDK时,若录音文件存储在阿里云OSS,不支持使用以 oss://为前缀的临时 URL。使用RESTful API时,若录音文件存储在阿里云OSS,支持使用以 oss://为前缀的临时 URL。但需注意:
  • 临时 URL 有效期48小时,过期后无法使用,请勿用于生产环境。
  • 文件上传凭证接口限流为 100 QPS 且不支持扩容,请勿用于生产环境、高并发及压测场景。
  • 生产环境建议使用阿里云OSS 等稳定存储,确保文件长期可用并规避限流问题。
rolestring(必选)用户消息的角色,固定为user
asr_optionsobject(可选)用来指定某些功能是否启用。仅千问3-ASR-Flash支持该参数。

属性

language string(可选)无默认值若已知音频的语种,可通过该参数指定待识别语种,以提升识别准确率。只能指定一个语种。若音频语种不确定,或包含多种语种(例如中英日韩混合),请勿指定该参数。
  • zh:中文(普通话、四川话、闽南语、吴语)
  • yue:粤语
  • en:英文
  • ja:日语
  • de:德语
  • ko:韩语
  • ru:俄语
  • fr:法语
  • pt:葡萄牙语
  • ar:阿拉伯语
  • it:意大利语
  • es:西班牙语
  • hi:印地语
  • id:印尼语
  • th:泰语
  • tr:土耳其语
  • uk:乌克兰语
  • vi:越南语
  • cs:捷克语
  • da:丹麦语
  • fil:菲律宾语
  • fi:芬兰语
  • is:冰岛语
  • ms:马来语
  • no:挪威语
  • pl:波兰语
  • sv:瑞典语
enable_itnboolean(可选)默认值为false是否启用ITN(Inverse Text Normalization,逆文本标准化)。该功能仅适用于中文和英文音频。开启后,语音识别结果中的中文数字(如"一百二十三")或英文数字(如"one hundred")将自动转换为阿拉伯数字(如"123")。参数值:
  • true:开启;
  • false:关闭。
以下示例为音频 URL 识别;本地音频文件识别示例请参见快速开始
curl -X POST "https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation" \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
    "model": "qwen3-asr-flash",
    "input": {
        "messages": [
            {
                "content": [
                    {
                        "audio": "{YOUR_AUDIO_URL}"
                    }
                ],
                "role": "user"
            }
        ]
    },
    "parameters": {
        "asr_options": {
            "enable_itn": false
        }
    }
}'

响应参数

request_idstring本次调用的唯一标识符。
Java SDK返回参数为requestId。
outputobject调用结果信息。

属性

choicesarray模型的输出信息。当result_format为message时返回choices参数。
finish_reasonstring有三种情况:
  • 正在生成时为null;
  • 因模型输出自然结束,或触发输入参数中的stop条件而结束时为stop;
  • 因生成长度过长而结束为length。
messageobject模型输出的消息对象。

属性

rolestring输出消息的角色,固定为assistant。contentarray输出消息的内容。

属性

textstring语音识别结果。
annotationsarray输出标注信息(如语种)

属性

languagestring被识别音频的语种。当请求参数language已指定语种时,该值与所指定的参数一致。
  • zh:中文(普通话、四川话、闽南语、吴语)
  • yue:粤语
  • en:英文
  • ja:日语
  • de:德语
  • ko:韩语
  • ru:俄语
  • fr:法语
  • pt:葡萄牙语
  • ar:阿拉伯语
  • it:意大利语
  • es:西班牙语
  • hi:印地语
  • id:印尼语
  • th:泰语
  • tr:土耳其语
  • uk:乌克兰语
  • vi:越南语
  • cs:捷克语
  • da:丹麦语
  • fil:菲律宾语
  • fi:芬兰语
  • is:冰岛语
  • ms:马来语
  • no:挪威语
  • pl:波兰语
  • sv:瑞典语
typestring固定为audio_info,表示音频信息。emotionstring被识别音频的情感。支持的情感如下:
  • surprised:惊讶
  • neutral:平静
  • happy:愉快
  • sad:悲伤
  • disgusted:厌恶
  • angry:愤怒
  • fearful:恐惧
usageobject本次请求的Token消耗信息。

属性

input_tokens_details object千问3-ASR-Flash输入内容长度(Token)。
text_tokens integer无需关注该参数。
output_tokens_details object千问3-ASR-Flash输出内容长度(Token)。
text_tokens integer千问3-ASR-Flash输出的识别结果文本长度(Token)。
seconds integer千问3-ASR-Flash音频时长(秒)。
{
    "output": {
        "choices": [
            {
                "finish_reason": "stop",
                "message": {
                    "annotations": [
                        {
                            "language": "zh",
                            "type": "audio_info",
                            "emotion": "neutral"
                        }
                    ],
                    "content": [
                        {
                            "text": "欢迎使用阿里云。"
                        }
                    ],
                    "role": "assistant"
                }
            }
        ]
    },
    "usage": {
        "input_tokens_details": {
            "text_tokens": 0
        },
        "output_tokens_details": {
            "text_tokens": 6
        },
        "seconds": 1
    },
    "request_id": "568e2bf0-d6f2-97f8-9f15-a57b11dc6977"
}

DashScope异步调用

流程说明

与OpenAI兼容模式或DashScope同步调用(均为一次请求、立即返回结果)不同,异步调用专为处理长音频文件或耗时较长的任务设计,该模式采用“提交-轮询”的两步式流程,避免了因长时间等待而导致的请求超时:
  1. 第一步:提交任务
    • 客户端发起一个异步处理请求。
    • 服务器验证请求后,不会立即执行任务,而是返回一个唯一的 task_id,表示任务已成功创建。
  2. 第二步:获取结果
    • 客户端使用获取到的 task_id,通过轮询方式反复调用结果查询接口。
    • 当任务处理完成后,结果查询接口将返回最终的识别结果。
您可以根据集成环境选择使用SDK或直接调用RESTful API。
  • 使用 SDK(示例代码请参见快速开始,请求参数请参见提交任务的请求参数请求参数,返回结果请参见异步调用识别结果说明 SDK封装了底层的API调用细节,提供了更便捷的编程体验。
    1. 提交任务:调用 async_call() (Python) 或 asyncCall() (Java) 方法提交任务。此方法将返回一个包含 task_id 的任务对象。
    2. 获取结果:使用上一步返回的任务对象或 task_id,调用 fetch() 方法获取结果。SDK内部会自动处理轮询逻辑,直到任务完成或超时。
    1. 使用 RESTful API
    直接调用HTTP接口提供了最大的灵活性。
    1. 提交任务,如果请求成功,响应参数响应参数中将包含一个 task_id
    2. 使用上一步获取的 task_id获取任务执行结果

提交任务

URL

  • 华北2(北京)
  • 新加坡
HTTP请求地址:POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/asr/transcriptionSDK调用配置的base_url:https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1调用时请将{WorkspaceId}替换为真实的Workspace ID
阿里云百炼为华北2(北京)、新加坡地域推出了业务空间专属域名,能够为推理请求提供卓越的性能和更高的稳定性,建议迁移至新域名:
  • 华北2(北京)地域:从 dashscope.aliyuncs.com 迁移至 {WorkspaceId}.cn-beijing.maas.aliyuncs.com
  • 新加坡地域:从 dashscope-intl.aliyuncs.com 迁移至 {WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
{WorkspaceId}需要替换为真实的Workspace ID。现有域名仍可正常使用。

请求参数

modelstring(必选)模型名称。仅适用于千问3-ASR-Flash-Filetrans模型。inputobject(必选)

属性

file_url string(必选)待识别音频文件URL,URL必须公网可访问。使用SDK时,若录音文件存储在阿里云OSS,不支持使用以 oss://为前缀的临时 URL。使用RESTful API时,若录音文件存储在阿里云OSS,支持使用以 oss://为前缀的临时 URL。但需注意:
  • 临时 URL 有效期48小时,过期后无法使用,请勿用于生产环境。
  • 文件上传凭证接口限流为 100 QPS 且不支持扩容,请勿用于生产环境、高并发及压测场景。
  • 生产环境建议使用阿里云OSS 等稳定存储,确保文件长期可用并规避限流问题。
parametersobject(可选)

属性

language string(可选)无默认值若已知音频的语种,可通过该参数指定待识别语种,以提升识别准确率。只能指定一个语种。若音频语种不确定,或包含多种语种(例如中英日韩混合),请勿指定该参数。
  • zh:中文(普通话、四川话、闽南语、吴语)
  • yue:粤语
  • en:英文
  • ja:日语
  • de:德语
  • ko:韩语
  • ru:俄语
  • fr:法语
  • pt:葡萄牙语
  • ar:阿拉伯语
  • it:意大利语
  • es:西班牙语
  • hi:印地语
  • id:印尼语
  • th:泰语
  • tr:土耳其语
  • uk:乌克兰语
  • vi:越南语
  • cs:捷克语
  • da:丹麦语
  • fil:菲律宾语
  • fi:芬兰语
  • is:冰岛语
  • ms:马来语
  • no:挪威语
  • pl:波兰语
  • sv:瑞典语
enable_itnboolean(可选)默认值为false是否启用ITN(Inverse Text Normalization,逆文本标准化)。该功能仅适用于中文和英文音频。开启后,语音识别结果中的中文数字(如"一百二十三")或英文数字(如"one hundred")将自动转换为阿拉伯数字(如"123")。参数值:
  • true:开启;
  • false:关闭。
enable_wordsboolean(可选)默认值为false控制是否返回字级别时间戳:
  • false:返回句级时间戳
  • true:返回字级时间戳 字级别时间戳仅支持以下语种:中文、英语、日语、韩语、德语、法语、西班牙语、意大利语、葡萄牙语、俄语,其他语种可能无法保证准确性
同时,该参数还影响断句规则:
  • false:基于 VAD(语音活动检测)断句
  • true:基于 VAD + 标点符号断句
channel_idarray(可选)默认值为[0]指定在多音轨音频文件中需要识别的音轨索引,索引从 0 开始。例如,[0] 表示识别第一个音轨,[0, 1] 表示同时识别第一和第二个音轨。如果省略此参数,则默认处理第一个音轨。
指定的每一个音轨都将独立计费。例如,为单个文件请求 [0, 1] 会产生两笔独立的费用。
  • cURL
  • Java
  • Python
# ======= 重要提示 =======
# 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。
# 新加坡地域和北京地域的API Key不同。获取API Key:https://help.aliyun.com/zh/model-studio/get-api-key
# === 执行时请删除该注释 ===

curl --location --request POST 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/asr/transcription' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header "Content-Type: application/json" \
--header "X-DashScope-Async: enable" \
--data '{
    "model": "qwen3-asr-flash-filetrans",
    "input": {
        "file_url": "{YOUR_AUDIO_URL}"
    },
    "parameters": {
        "channel_id":[
            0
        ],
        "enable_itn": false
    }
}'

响应参数

request_idstring本次调用的唯一标识符。outputobject调用结果信息。

属性

task_idstring任务ID。该ID在查询语音识别任务接口中作为请求参数传入。task_statusstring任务状态:
  • PENDING:任务排队中
  • RUNNING:任务处理中
  • SUCCEEDED:任务执行成功
  • FAILED:任务执行失败
  • UNKNOWN:任务不存在或状态未知
{
    "request_id": "92e3decd-0c69-47a8-************",
    "output": {
        "task_id": "8fab76d0-0eed-4d20-************",
        "task_status": "PENDING"
    }
}

获取任务执行结果

URL

  • 华北2(北京)
  • 新加坡
HTTP请求地址:GET https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id}SDK调用配置的base_url:https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1调用时请将{WorkspaceId}替换为真实的Workspace ID
阿里云百炼为华北2(北京)、新加坡地域推出了业务空间专属域名,能够为推理请求提供卓越的性能和更高的稳定性,建议迁移至新域名:
  • 华北2(北京)地域:从 dashscope.aliyuncs.com 迁移至 {WorkspaceId}.cn-beijing.maas.aliyuncs.com
  • 新加坡地域:从 dashscope-intl.aliyuncs.com 迁移至 {WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
{WorkspaceId}需要替换为真实的Workspace ID。现有域名仍可正常使用。

请求参数

task_idstring(必选)任务ID。将提交任务返回结果中的task_id作为参数传入,查询语音识别结果。
  • cURL
  • Java
  • Python
# ======= 重要提示 =======
# 以下为华北2(北京)地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。
# 新加坡地域和北京地域的API Key不同。获取API Key:https://help.aliyun.com/zh/model-studio/get-api-key
# === 执行时请删除该注释 ===

curl --location --request GET 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id}' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header "Content-Type: application/json"

响应参数

request_idstring本次调用的唯一标识符。outputobject调用结果信息。

属性

task_idstring任务ID。该ID在查询语音识别任务接口中作为请求参数传入。task_statusstring任务状态:
  • PENDING:任务排队中
  • RUNNING:任务处理中
  • SUCCEEDED:任务执行成功
  • FAILED:任务执行失败
  • UNKNOWN:任务不存在或状态未知
resultobject语音识别结果。
transcription_urlstring识别结果文件的下载 URL,链接有效期为 24 小时。过期后无法查询任务,也无法通过先前的 URL 下载结果。
识别结果以 JSON 文件保存,可通过该链接下载文件,或直接使用 HTTP 请求读取文件内容。
详情参见异步调用识别结果说明
submit_timestring任务提交时间。schedule_timestring任务调度时间,即开始执行时间。end_timestring任务结束时间。task_metricsobject任务指标,包含子任务状态的统计信息。
TOTALinteger子任务总数。SUCCEEDEDinteger子任务成功数。FAILEDinteger子任务失败数。
codestring错误码,仅在任务失败时返回。messagestring错误信息,仅任务失败时返回。usageobject本次请求的Token消耗信息。
seconds integer千问3-ASR-Flash音频时长(秒)。
{
    "request_id": "6769df07-2768-4fb0-ad59-************",
    "output": {
        "task_id": "9be1700a-0f8e-4778-be74-************",
        "task_status": "RUNNING",
        "submit_time": "2025-10-27 14:19:31.150",
        "scheduled_time": "2025-10-27 14:19:31.233",
        "task_metrics": {
            "TOTAL": 1,
            "SUCCEEDED": 0,
            "FAILED": 0
        }
    }
}

异步调用识别结果说明

file_url string被识别的音频文件URL。audio_infoobject被识别音频文件相关信息。

属性

format string音频格式。sample_rate integer音频采样率。
transcriptsarray完整的识别结果列表,每个元素对应一条音轨的识别内容。

属性

channel_idinteger音轨索引,以0为起始。textstring识别结果文本。sentencesobject句子级别的识别结果列表。

属性

begin_timeinteger句子开始时间戳(毫秒)。end_timeinteger句子结束时间戳(毫秒)。textstring识别结果文本。sentence_idinteger句子索引,以0为起始。languagestring被识别音频的语种。当请求参数language已指定语种时,该值与所指定的参数一致。
  • zh:中文(普通话、四川话、闽南语、吴语)
  • yue:粤语
  • en:英文
  • ja:日语
  • de:德语
  • ko:韩语
  • ru:俄语
  • fr:法语
  • pt:葡萄牙语
  • ar:阿拉伯语
  • it:意大利语
  • es:西班牙语
  • hi:印地语
  • id:印尼语
  • th:泰语
  • tr:土耳其语
  • uk:乌克兰语
  • vi:越南语
  • cs:捷克语
  • da:丹麦语
  • fil:菲律宾语
  • fi:芬兰语
  • is:冰岛语
  • ms:马来语
  • no:挪威语
  • pl:波兰语
  • sv:瑞典语
emotionstring被识别音频的情感。支持的情感如下:
  • surprised:惊讶
  • neutral:平静
  • happy:愉快
  • sad:悲伤
  • disgusted:厌恶
  • angry:愤怒
  • fearful:恐惧
wordsobject词级别的识别结果列表。当请求参数enable_words设为true时展示该结果。

属性

begin_timeinteger开始时间戳(毫秒)。end_timeinteger结束时间戳(毫秒)。textstring识别结果文本。punctuationstring标点符号。
{
    "file_url": "https://***.mp3",
    "audio_info": {
        "format": "mp3",
        "sample_rate": 22050
    },
    "transcripts": [
        {
            "channel_id": 0,
            "text": "欢迎使用阿里云。",
            "sentences": [
                {
                    "sentence_id": 0,
                    "begin_time": 0,
                    "end_time": 1440,
                    "language": "zh",
                    "emotion": "neutral",
                    "text": "欢迎使用阿里云。",
                    "words": [
                        {
                            "begin_time": 0,
                            "end_time": 160,
                            "text": "欢",
                            "punctuation": ""
                        },
                        {
                            "begin_time": 160,
                            "end_time": 320,
                            "text": "迎",
                            "punctuation": ""
                        },
                        {
                            "begin_time": 320,
                            "end_time": 640,
                            "text": "使",
                            "punctuation": ""
                        },
                        {
                            "begin_time": 640,
                            "end_time": 720,
                            "text": "用",
                            "punctuation": ""
                        },
                        {
                            "begin_time": 880,
                            "end_time": 960,
                            "text": "阿",
                            "punctuation": ""
                        },
                        {
                            "begin_time": 1040,
                            "end_time": 1120,
                            "text": "里",
                            "punctuation": ""
                        },
                        {
                            "begin_time": 1120,
                            "end_time": 1440,
                            "text": "云",
                            "punctuation": "。"
                        }
                    ]
                }
            ]
        }
    ]
}
文本生成
图像生成
视频生成
3D模型生成
音频
Realtime API
  • 概述
向量与排序
模型生产