Skip to main content
Vidu

Vidu-参考生视频 API 参考

Vidu-参考生视频模型支持传入 参考图片 和 文本提示词 ,将图片中的主体角色融合到提示词描述的场景中,生成流畅的视频内容。

本文档仅适用于华北2(北京)地域,且必须使用该地域的API Key

服务开通

请前往阿里云百炼控制台,搜索 Vidu,找到 Vidu 模型卡片,单击立即开通;在弹窗内确认开通及授权。

适用范围

为确保调用成功,请务必保证模型、Endpoint URL 和 API Key 均属于同一地域。跨地域调用将会失败。

HTTP 调用

由于参考生视频任务耗时较长(通常为 1-5 分钟),API 采用异步调用。整个流程包含 "创建任务 -> 轮询获取" 两个核心步骤,具体如下:

步骤 1:创建任务获取任务 ID

北京地域POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis 调用时请将{WorkspaceId}替换为真实的业务空间ID
  • 创建成功后,使用接口返回的 task_id 查询结果,task_id 有效期为 24 小时。请勿重复创建任务,轮询获取即可。
  • 新手指引请参见Postman

请求参数

请求头(Headers)
Content-Typestring(必选)请求内容类型。此参数必须设置为application/jsonAuthorizationstring(必选)请求身份认证。接口使用阿里云百炼API Key进行身份认证。示例值:Bearer sk-xxxx。X-DashScope-Asyncstring(必选)异步处理配置参数。HTTP请求只支持异步,必须设置为enable
缺少此请求头将报错:“current user api does not support synchronous calls”。
请求体(Request Body)
model string (必选)模型名称。可选值为:
  • vidu/viduq3-ad_reference2video
  • vidu/viduq3-drama_reference2video
  • vidu/viduq3-mix_reference2video
  • vidu/viduq3_reference2video
  • vidu/viduq3-turbo_reference2video
  • vidu/viduq2-pro_reference2video
  • vidu/viduq2_reference2video

模型选型

  • 广告视频:推荐 viduq3-ad,面向广告行业,支持营销级智能切镜、运镜和音效直出,上传商品图即可生成广告视频。
  • 精品剧 / AI 漫剧:推荐 viduq3-drama,角色一致性强、动效细腻、情绪表达真实,适合剧情向内容生产。
  • 通用场景:推荐 viduq3-mix,画面质感与动态效果均衡,适合大多数参考生视频需求。
  • 追求速度与性价比:推荐 viduq3-turbo,生成速度最快。
input object (必选)输入的基本信息,包括参考图片和提示词。

属性

prompt string (必选)文本提示词。用来描述生成视频中期望包含的元素和视觉特点。支持中英文,不超过 5000 个字符,超过部分会自动截断。示例值:男人坐在靠窗的椅子上,手持吉他,在咖啡厅旁演奏一首舒缓的美国乡村民谣。提示词编写请参见Vidu视频生成Prompt指南media array (必选)媒体素材列表,用于指定视频生成所需的参考图像。数组的每个元素为一个媒体对象,包含 typeurl 字段。

元素属性

type string (必选)媒体素材类型。可选值与模型有关:

仅传入参考图像

支持模型:vidu/viduq3-ad_reference2video、vidu/viduq3-drama_reference2video、vidu/viduq3-mix_reference2video、vidu/viduq3_reference2video、vidu/viduq3-turbo_reference2video、vidu/viduq2_reference2video固定为:
  • image:参考图像。
素材限制:图像数量为1~7张。

传入参考图像和视频

支持模型:vidu/viduq2-pro_reference2video可选值为:
  • image:参考图像。必选。
  • video:参考视频。可选。
素材限制:
  • 仅参考图像:图像数量为1~7张。
  • 参考图像和视频:
    • 图像数量为1~4张。
    • 视频数量为1~2个。
url string (必选)媒体素材URL。素材包括图像、视频。

传入图像(type=image)

参考图像URL,必须为公网可访问的 URL。图像限制:
  • 格式:JPEG、JPG、PNG、WEBP。
  • 宽高比:1:4~4:1。
  • 文件大小:不超过 50MB。

传入视频(type=video)

参考视频URL,必须为公网可访问的 URL。视频限制:
  • 格式:mp4、avi、mov。
  • 分辨率:总像素值不小于128*128。
  • 宽高比:1:4~4:1。
  • 时长:传入1个参考视频时为1~8秒;传入2个参考视频时各为1~5秒。
  • 文件大小:不超过 50MB。
parameters object (必选)视频生成参数。如设置视频分辨率、时长等。

属性

resolution string (可选)
resolution直接影响费用,请在调用前确认模型价格
生成视频的分辨率。可选值与模型有关:
  • vidu/viduq3-ad_reference2video:可选720P、1080P。默认值为720P。
  • vidu/viduq3-drama_reference2video:可选720P、1080P。默认值为1080P。
  • vidu/viduq3-mix_reference2video:可选720P、1080P。默认值为720P。
  • vidu/viduq3_reference2video:可选540P、720P、1080P。默认值为720P。
  • vidu/viduq3-turbo_reference2video:可选540P、720P、1080P。默认值为720P。
  • vidu/viduq2-pro_reference2video:可选540P、720P、1080P。默认值为720P。
  • vidu/viduq2_reference2video:可选540P、720P、1080P。默认值为720P。
size string (可选)生成视频的分辨率,格式为宽*高的像素值。默认值根据resolution而定:
  • 当 resolution=540P 时,size 默认为 1024*576
  • 当 resolution=720P 时,size 默认为 1280*720
  • 当 resolution=1080P 时,size 默认为 1920*1080
各模型支持的宽高比有所不同:
  • vidu/viduq3-drama_reference2video:仅支持 16:9 和 9:16。
  • 其他模型:支持 16:9、4:3、1:1、3:4、9:16。

分辨率档位

宽高比

size 取值(宽*高)

540P

16:9

1024*576

4:3

1024*768

1:1

1024*1024

3:4

768*1024

9:16

576*1024

720P

16:9

1280*720

4:3

1280*960

1:1

1280*1280

3:4

960*1280

9:16

720*1280

1080P

16:9

1920*1080

4:3

1920*1440

1:1

1808*1808

3:4

1440*1920

9:16

1080*1920

duration integer (必选)
duration直接影响费用,按秒计费,请在调用前确认模型价格
生成视频的时长,单位为秒。
  • vidu/viduq3-ad_reference2video:取值为[3, 15]之间的整数。默认值为5
  • vidu/viduq3-drama_reference2video:取值为[2, 15]之间的整数。默认值为5
    • 当分镜数量过多或明显少于duration时,模型可能自动调整时长以保障故事完整性,实际视频时长可能多于或少于duration设定值。
    • 计费按实际输出时长计算。
  • vidu/viduq3-mix_reference2video:取值为[1, 16]之间的整数。默认值为5
  • vidu/viduq3_reference2video:取值为[1, 16]之间的整数。默认值为5
  • vidu/viduq3-turbo_reference2video:取值为[1, 16]之间的整数。默认值为5
  • vidu/viduq2-pro_reference2video:取值为[1, 10]之间的整数。默认值为5
    • 特殊设置:支持设置为0,表示自动规划时长,上限不超过 10 秒。
      • 若上传 1 个参考视频:生成视频时长通常等于该参考视频时长。
      • 若上传 2 个参考视频:模型结合提示词,生成视频时长通常等于”主要参考视频”的时长。
  • vidu/viduq2_reference2video:取值为[1, 10]之间的整数。默认值为5
audio boolean (可选)支持模型:vidu/viduq3-ad_reference2video、vidu/viduq3-mix_reference2video、vidu/viduq3_reference2video、vidu/viduq3-turbo_reference2video。是否生成有声视频。开启后模型将根据视频内容自动生成匹配的背景音乐或音效。
  • false:默认值,输出无声视频。
  • true:输出有声视频。
vidu/viduq3-drama_reference2video 不支持该参数,默认输出有声视频。
watermark boolean (可选)是否添加水印标识,水印位于视频右下角,文案固定为“内容由AI生成”。
  • false:默认值,不添加水印。
  • true:添加水印。
seedinteger(可选)随机数种子,取值范围为[0, 2147483647]未指定时,系统自动生成随机种子。若需提升生成结果的可复现性,建议固定seed值。请注意,由于模型生成具有概率性,即使使用相同 seed,也不能保证每次生成结果完全一致。示例值:12345。
  • 参考生视频-广告(仅参考图像)
  • 参考生视频-短剧(仅参考图像)
  • 参考生视频(仅参考图像)
  • 参考生视频(参考图像+视频)
支持模型:vidu/viduq3-ad_reference2video。调用时请将{WorkspaceId}替换为真实的业务空间ID
curl --location 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
    -H 'X-DashScope-Async: enable' \
    -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
    -H 'Content-Type: application/json' \
    -d '{
    "model": "vidu/viduq3-ad_reference2video",
    "input": {
        "media": [
            {
                "type": "image",
                "url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260713/dtnctw/ad-1.png"
            },
            {
                "type": "image",
                "url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260713/bspdpd/ad-2.png"
            },
            {
                "type": "image",
                "url": "https://help-static-aliyun-doc.aliyuncs.com/file-manage-files/zh-CN/20260713/mhsjyy/ad-3.png"
            }
        ],
        "prompt": "一个瑜伽裤的广告。商品是一条左右各有一个口袋的黑色高腰瑜伽裤。亚洲模特开心地说"我现在再也不穿没有口袋的瑜伽裤了"。画面保持清晰、稳定、容易理解。"
    },
    "parameters": {
        "duration": 8,
        "size": "1080*1920",
        "resolution": "1080P",
        "watermark": true
    }
}'

响应参数

output object任务输出信息。

属性

task_id string任务ID。查询有效期24小时。task_status string任务状态。

枚举值

  • PENDING:任务排队中
  • RUNNING:任务处理中
  • SUCCEEDED:任务执行成功
  • FAILED:任务执行失败
  • CANCELED:任务已取消
  • UNKNOWN:任务不存在或状态未知
request_idstring请求唯一标识。可用于请求明细溯源和问题排查。codestring请求失败的错误码。请求成功时不会返回此参数,详情请参见错误码messagestring请求失败的详细信息。请求成功时不会返回此参数,详情请参见错误码
  • 成功响应
  • 异常响应
请保存 task_id,用于查询任务状态与结果。
{
    "output": {
        "task_status": "PENDING",
        "task_id": "0385dc79-5ff8-4d82-bcb6-xxxxxx"
    },
    "request_id": "4909100c-7b5a-9f92-bfe5-xxxxxx"
}

步骤 2:根据任务 ID 查询结果

北京地域GET https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id}
  • 轮询建议:视频生成过程约需数分钟,建议采用轮询机制,并设置合理的查询间隔(如 15 秒)来获取结果。
  • 任务状态流转:PENDING(排队中)→ RUNNING(处理中)→ SUCCEEDED(成功)/ FAILED(失败)。
  • task_id 有效期24 小时,超时后将无法查询结果,接口将返回任务状态为UNKNOWN
  • RPS 限制:查询接口默认 RPS 为 20。如需更高频查询或事件通知,建议配置异步任务回调
  • 更多操作:如需批量查询、取消任务等操作,请参见管理异步任务

请求参数

请求头(Headers)
Authorizationstring(必选)请求身份认证。接口使用阿里云百炼API Key进行身份认证。示例值:Bearer sk-xxxx。
URL 路径参数(Path parameters)
task_id string(必选)任务ID。
  • 查询任务结果
{task_id}完整替换为上一步接口返回的task_id的值。task_id查询有效期为24小时,并请将{WorkspaceId}替换为真实的业务空间ID
curl -X GET https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/tasks/{task_id} \
--header "Authorization: Bearer $DASHSCOPE_API_KEY"

响应参数

outputobject任务输出信息。

属性

task_id string任务ID。查询有效期24小时。task_status string任务状态。

枚举值

  • PENDING:任务排队中
  • RUNNING:任务处理中
  • SUCCEEDED:任务执行成功
  • FAILED:任务执行失败
  • CANCELED:任务已取消
  • UNKNOWN:任务不存在或状态未知
轮询过程中的状态流转:
  • PENDING(排队中) → RUNNING(处理中)→ SUCCEEDED(成功)/ FAILED(失败)。
  • 初次查询状态通常为 PENDING(排队中)或 RUNNING(处理中)。
  • 当状态变为 SUCCEEDED 时,响应中将包含生成的视频URL。
  • 若状态为 FAILED,请检查错误信息并重试。
  • 若状态为 CANCELED,表示任务已取消,如需继续请重新提交任务。
  • 若状态为 UNKNOWN,表示任务不存在或状态未知,可能在 task_id 不存在或超过 24 小时有效期后出现。
submit_time string任务提交时间。格式为 YYYY-MM-DD HH:mm:ss.SSS。scheduled_time string任务执行时间。格式为 YYYY-MM-DD HH:mm:ss.SSS。end_time string任务完成时间。格式为 YYYY-MM-DD HH:mm:ss.SSS。video_urlstring视频 URL。仅在 task_status 为 SUCCEEDED 时返回。视频格式为 MP4(H.264 编码)。视频链接有效期24 小时,请及时下载。orig_prompt string原始输入的prompt,对应请求参数promptcodestring请求失败的错误码。请求成功时不会返回此参数,详情请参见错误码messagestring请求失败的详细信息。请求成功时不会返回此参数,详情请参见错误码
usage object输出信息统计。只对成功的结果计数。

属性

duration integer生成视频的总视频时长,用于计费。size string生成视频的分辨率。fps integer生成视频的帧率。固定为 24。SR string生成视频的分辨率档位。audio boolean生成视频是否为有声视频。video_count integer生成视频的数量。固定为 1。reference_type string参考素材类型。
request_idstring请求唯一标识。可用于请求明细溯源和问题排查。
  • 任务执行成功
  • 任务执行失败
  • 任务查询过期
视频URL仅保留24小时,超时后会被自动清除,请及时保存生成的视频。
{
    "request_id": "8f240644-efe8-43bf-86ff-xxxxxx",
    "output": {
        "task_id": "b7e05baa-c318-440d-b293-xxxxxx",
        "task_status": "SUCCEEDED",
        "submit_time": "2026-03-27 15:10:42.723",
        "scheduled_time": "2026-03-27 15:10:42.754",
        "end_time": "2026-03-27 15:11:17.388",
        "orig_prompt": "男人坐在靠窗的椅子上,手持吉他,在咖啡厅旁演奏一首舒缓的美国乡村民谣",
        "video_url": "https://prod-ss-vidu.s3.cn-northwest-1.amazonaws.com.cn/xxx.mp4?xxx"
    },
    "usage": {
        "duration": 5,
        "size": "960*528",
        "output_video_duration": 5,
        "fps": 24,
        "video_count": 1,
        "audio": false,
        "reference_type": "image,video",
        "SR": "540"
    }
}

错误码

如果模型调用失败并返回报错信息,请参见错误码进行解决。

常见问题

Q:size 与 resolution 必须同时传入吗?

A: 不必。二者均为可选参数,但推荐同时传入。同时传入可精准控制生成视频的宽高比,具体参见size取值 若不同时传入,系统将按以下两种场景处理:
  • 仅传 size:size参数会被忽略,系统强制按默认的 resolution=720P 及其对应的size默认值(1280*720)处理。
    例如:接口返回为size="1280*720", SR=720。
  • 仅传 resolution:按指定分辨率档位及该档位对应的 16:9 比例输出。
    例如:当resolution=540P时,接口返回 size="960528", SR=540;当resolution=1080P时,接口返回 size="19201080", SR=1080。