多模态向量模型将文本、图像和视频转换为同一语义空间中的向量表示,支持跨模态检索、内容分类和语义相似度计算。
核心能力
- 跨模态检索:以文搜图、以图搜视频、以图搜图等跨模态语义搜索。
- 语义相似度计算:在统一向量空间中衡量不同模态内容之间的语义相似性。
- 内容分类与聚类:基于语义向量进行智能分组、打标和聚类分析。
关键特性 :所有模态(文本、图片、视频)的向量均位于同一语义空间,可通过余弦相似度等方法直接进行跨模态匹配与比较。模型选型和使用方法详见 文本与多模态向量化 。
向量类型说明
多模态向量模型支持两种向量生成方式:
- 多模态独立向量:为 contents 中的每个输入(文本、图片、视频、多图)分别生成独立向量。例如,输入 1 段文本和 1 张图片,返回 2 个独立向量。适用于逐项对比不同内容的场景,如以图搜图、以文搜图。
-
多模态融合向量:将 contents 中的所有输入融合为 1 个向量,实现跨模态综合语义表征。适用于需要整体理解多模态内容的场景,如将商品图片和描述文本融合为统一表征进行检索。
qwen3-vl-embedding通过设置enable_fusion=true开启融合模式;tongyi-embedding-vision-plus-2026-03-06和tongyi-embedding-vision-flash-2026-03-06通过将 text、image、video 放在同一个 content 对象中实现融合。融合向量支持以下组合:- 文本 + 图片融合
- 文本 + 视频融合
- 多图 + 文本融合(传入多个 image 条目)
- 图片 + 视频 + 文本混合融合
模型介绍、选型建议和使用方法,请参考文本与多模态向量化。qwen2.5-vl-embedding仅支持融合向量,不支持独立向量。tongyi-embedding-vision-plus和tongyi-embedding-vision-flash仅支持独立向量。tongyi-embedding-vision-plus-2026-03-06和tongyi-embedding-vision-flash-2026-03-06同时支持独立向量和融合向量,融合向量通过将 text、image、video 放在同一个 content 对象中实现。
模型概览
- 北京
- 新加坡
模型名称 | 向量维度 | 文本长度限制 | 图片大小限制 | 视频大小限制 | 单价(每千输入Token) | 免费额度(注) |
|---|---|---|---|---|---|---|
qwen3-vl-embedding | 2560(默认), 2048, 1536, 1024, 768, 512, 256 | 32,000 Token | 单张大小不超过10 MB | 视频文件大小不超过 50 MB | 图片/视频:0.0018元 文本:0.0007元 | 100万Token 有效期:自开通百炼/模型发布/申请通过之日起90天(以较晚者为准) |
qwen2.5-vl-embedding | 2048, 1024(默认), 768, 512 | 单张大小不超过5 MB | ||||
tongyi-embedding-vision-plus-2026-03-06 | 1152(默认), 1024, 512, 256, 128, 64 | 1,024 Token | 建议单张大小不超过5 MB,最大10 MB。支持多图,最多支持输入64张 | 视频文件大小不超过 50 MB 且编码类型为H.264/H.265 | 0.0005元 | |
tongyi-embedding-vision-flash-2026-03-06 | 768(默认), 512, 256, 128, 64 | 0.00015元 | ||||
tongyi-embedding-vision-plus | 1152 | 单张大小不超过3 MB。支持多图,最多支持输入8张 | 视频文件大小不超过 10 MB | 0.0005元 | ||
tongyi-embedding-vision-flash | 768 | 0.00015元 | ||||
multimodal-embedding-v1 | 1,024 | 512 Token | 单张大小不超过3 MB | 视频文件大小不超过 10 MB | 图片/视频:0.0009 元 文本:0.0007 元 |
输入格式与语种限制:
| 多模态融合向量模型 | ||||
|---|---|---|---|---|
| 模型 | 文本 | 图片 | 视频 | 单次请求条数 |
| qwen3-vl-embedding | 支持中、英、日、韩、法、德等33种主流语言
所有支持语言 中文、日语、韩语、印尼语、越南语、泰语、英语、法语、德语、俄语、葡萄牙语、西班牙语、意大利语、瑞典语、丹麦语、捷克语、挪威语、荷兰语、芬兰语、土耳其语、波兰语、斯瓦希里语、罗马尼亚语、塞尔维亚语、希腊语、哈萨克语、乌兹别克语、宿务语、阿拉伯语、乌尔都语、波斯语、印地语 / 天城语、希伯来语。 | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS, SGI(支持URL或Base64) | MP4, AVI, MOV(仅支持URL) | 一次请求中传入内容元素总数不超过 20。图片数量不超过10,视频数量不超过1。 |
| qwen2.5-vl-embedding | 支持中、英、日、韩、法、德等11种主流语言
所有支持语言 中文、英语、日语、韩语、法语、德语、俄语、葡萄牙语、西班牙语、意大利语、印尼语 | 一次请求内,图片、文本、视频、融合对象每种类型最多出现 1 次。 | ||
| 多模态向量模型 | ||||
| 模型 | 文本 | 图片 | 视频 | 单次请求条数 |
| tongyi-embedding-vision-plus-2026-03-06 | 支持中、英、日、韩等超30种主流语言
所有支持语言 中文、日语、韩语、印尼语、越南语、泰语、英语、法语、德语、俄语、葡萄牙语、西班牙语、意大利语、瑞典语、丹麦语、捷克语、挪威语、荷兰语、芬兰语、土耳其语、波兰语、斯瓦希里语、罗马尼亚语、塞尔维亚语、希腊语、哈萨克语、乌兹别克语、宿务语、阿拉伯语、乌尔都语、波斯语、印地语 / 天城语、希伯来语。 | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS, SGI(支持URL或Base64) | MP4, MPEG, MOV, MPG, WEBM, AVI, FLV, MKV(仅支持URL) | 一次请求中传入内容元素总数不超过 20,单次图片总数不超过64,视频数量不超过8。 |
| tongyi-embedding-vision-flash-2026-03-06 | ||||
| tongyi-embedding-vision-plus | 中文与英文 | JPG, PNG, BMP (支持URL或Base64) | MP4, MPEG, MOV, MPG, WEBM, AVI, FLV, MKV(仅支持URL) | 暂无传入内容元素数量限制,输入内容Token数不超过单批次处理Token数量上限即可。 |
| tongyi-embedding-vision-flash | ||||
| multimodal-embedding-v1 | 中文与英文 | JPG, PNG, BMP (支持URL或Base64) | 一次请求中传入内容元素总数不超过 20;图片、视频各最多 1 条,文本最多 20 条,共享总条数上限。 | |
所有模型均支持 text、image、video 三种输入类型及其组合。tongyi-embedding-vision-plus、tongyi-embedding-vision-flash、tongyi-embedding-vision-plus-2026-03-06和tongyi-embedding-vision-flash-2026-03-06额外支持multi_images多图序列输入。
模型能力对照
模型 | 默认维度 | 向量类型 | 支持的输入 | 说明 |
qwen3-vl-embedding | 2560 | 独立 / 融合 | text、image、video、多个 image 条目 | 通过 |
qwen2.5-vl-embedding | 1024 | 仅融合 | text、image、video | 始终返回 1 个融合向量,不支持独立向量,不支持多图输入 |
tongyi-embedding-vision-plus-2026-03-06 | 1152 | 独立 / 融合 | text、image、video、multi_images | 基于 Qwen3 底座,支持多分辨率、30+ 语言、融合向量 |
tongyi-embedding-vision-flash-2026-03-06 | 768 | |||
tongyi-embedding-vision-plus | 1152 | 仅独立 | 支持 multi_images 多图序列(最多 8 张) | |
tongyi-embedding-vision-flash | 768 | |||
multimodal-embedding-v1 | 1024 | text、image、video | 不支持 dimension 参数,固定 1024 维 |
前提条件
您需要已获取与配置 API Key并配置API Key到环境变量。如果通过SDK调用,还需要安装DashScope SDK。请将示例代码中的 DASHSCOPE_API_HOST 替换为获取的 API Host。
HTTP调用
POST https://dashscope.aliyuncs.com/api/v1/services/embeddings/multimodal-embedding/multimodal-embedding
请求 |
以下示例使用 |
请求头(Headers) | |
Content-Typestring(必选)请求内容类型。此参数必须设置为application/json。 | |
Authorizationstring(必选)请求身份认证。接口使用阿里云百炼API Key进行身份认证。示例值:Bearer sk-xxxx。 | |
请求体(Request Body) | |
modelstring(必选)模型名称。设置为模型概览中的模型名称。 | |
inputobject(必选)输入内容。
属性 contents array(必选)待处理的内容列表。每个元素是一个字典或者字符串,用于指定内容的类型和值。格式为{"模态类型": "输入字符串或图像、视频url"}。支持text, image, video和multi_images四种模态类型。
object (可选)向量处理参数。HTTP调用需包装在parameters对象中,SDK调用可直接使用以下参数。
属性 output_type string (可选)用户指定输出向量表示格式,目前仅支持dense。dimension integer (可选)用于用户指定输出向量维度。不同模型支持的值不同:
float (可选)控制视频的帧数,比例越小,实际抽取的帧数越少,范围为 [0,1]。默认值为1.0。instruct string (可选)添加自定义任务说明,可用于指导模型理解查询意图。建议使用英文撰写,通常可带来约 1%–5% 的效果提升。enable_fusion bool (可选)是否生成融合向量。仅 qwen3-vl-embedding 模型支持该参数。设置为 true 时,将 contents 中的所有多模态内容融合为 1 个向量;默认为 false,各模态独立生成向量。融合向量支持文本+图片、文本+视频、多图+文本(传入多个 image 条目)、图片+视频+文本等组合,适用于需要综合理解多模态内容的检索场景。res_level integer (可选)指定输入分辨率档位,支持设置 0/1/2/3 四档,对应的单图 token 分别是 127/402/578/1026,默认值为 1(402 token)。仅 tongyi-embedding-vision-plus-2026-03-06 和 tongyi-embedding-vision-flash-2026-03-06 模型支持该参数。对于 IPC/自驾/视觉文字等图像分辨率敏感的场景,高分辨率(res_level=3)可提升 5%-10% 效果。max_video_frames integer (可选)控制视频的最大采样帧数上限,最大不超过 64,默认值为 8。仅 tongyi-embedding-vision-plus-2026-03-06 和 tongyi-embedding-vision-flash-2026-03-06 模型支持该参数。 |
响应 |
不同模型返回的 usage 字段存在差异,请参考以下说明:
|
outputobject任务输出信息。
属性 embeddings array向量结果列表,每个对象对应输入列表中的一个元素。
属性 index int结果在输入列表中的索引。embeddingarray生成的向量数组,维度取决于模型及 dimension 参数设置。typestring结果对应的输入类型。text、image、video、multi_images 分别对应文本、图片、视频、多图输入。以下为特殊类型: fused 为 tongyi-embedding-vision-plus-2026-03-06 和 tongyi-embedding-vision-flash-2026-03-06 模型返回的融合向量类型;fusion 为 qwen3-vl-embedding或qwen2.5-vl-embedding模型在融合向量模式下返回的类型;vl 为 qwen3-vl-embedding 模型在独立向量模式下返回的类型。 | |
request_idstring请求唯一标识。可用于请求明细溯源和问题排查。 | |
codestring请求失败的错误码。请求成功时不会返回此参数,详情请参见错误码。 | |
messagestring请求失败的详细信息。请求成功时不会返回此参数,详情请参见错误码。 | |
usageobject输出信息统计。
属性 input_tokens int本次请求输入内容的 Token 数目。对于 qwen3-vl-embedding 和 qwen2.5-vl-embedding 模型,该值仅包含文本 Token(含系统模板 Token),不包含图片/视频 Token;对于 tongyi-embedding-vision-* 系列模型,该值包含文本和图片/视频 Token 的总和。input_tokens_detailsobject输入 Token 的详细分类信息。仅 tongyi-embedding-vision-* 系列模型返回此字段,qwen3-vl-embedding、qwen2.5-vl-embedding 和 multimodal-embedding-v1 不返回此字段。
属性 image_tokens int输入内容中图片或视频等视觉部分消耗的 Token 数量,不包含文本(文本部分见 text_tokens)。图片消耗的 Token 数量与输入图片的分辨率有关,分辨率越高消耗的 Token 越多;若输入为视频,系统会先对视频抽帧,再基于抽帧结果计算 Token。text_tokensint输入内容中文本部分消耗的 Token 数量(不包含图片或视频等视觉部分)。int本次请求输出的 Token 数目。仅 tongyi-embedding-vision-* 系列模型返回此字段,其他模型不返回此字段。total_tokensint输入与输出的 Token 总数。对于 qwen3-vl-embedding 模型,total_tokens = input_tokens + image_tokens。仅 qwen3-vl-embedding 和 tongyi-embedding-vision-* 系列模型返回此字段,qwen2.5-vl-embedding 和 multimodal-embedding-v1 不返回此字段。image_tokensint本次请求输入的图片或视频等视觉部分消耗的 Token 数量(不包含文本)。图片消耗的 Token 数量与输入图片的分辨率有关;系统会对输入视频进行抽帧处理,帧数上限受系统配置控制,随后基于处理结果计算 Token。仅 qwen3-vl-embedding、qwen2.5-vl-embedding 和 multimodal-embedding-v1 返回此字段(作为顶层字段),tongyi-embedding-vision-* 系列模型的图片 Token 包含在 input_tokens_details.image_tokens 中。image_countint本次请求输入的图片数量。仅 multimodal-embedding-v1 返回此字段。durationint本次请求输入的视频时长(秒)。仅 multimodal-embedding-v1 返回此字段。 |
SDK使用
SDK 的 input 参数对应HTTP请求体中的 input.contents,两者结构 不一致 。
代码示例
- 图片向量化示例
- 视频向量化示例
- 文本向量化示例
- 融合向量化示例
- 多图融合向量化示例
- 2026-03-06 快照版本示例
- 使用图片URL
- 使用本地图片