检索系统在“召回”阶段为保证效率,返回的结果可能不够精准。排序模型能对召回的文档进行二次精准排序,确保将与用户查询最相关的结果排在最前,有效提升应用准确率。
模型概览
模型名称 | 最大文档数 | 单条最大输入Token | 请求最大输入Token | 语种支持 | 应用场景 |
|---|---|---|---|---|---|
qwen3-vl-rerank | 文本:100 图片:40 视频:4 | 8,000 | 120,000 | 中、英、日、韩、法、德等33种主流语言 |
|
qwen3-rerank | 500 | 4,000 | 中文、英语、西班牙语、法语、葡萄牙语、印尼语、日语、韩语、德语、俄罗斯语等100+主流语种 |
| |
gte-rerank-v2 | 30,000 | 中、英、日、韩、泰语、西、法、葡、德、印尼语、阿拉伯语等50余语种 |
- 单条最大输入Token:每个Query或Document的最大Token数量。输入内容超长将被截断。API仅基于截断后的内容计算,这可能导致排序结果不准确。
- 单次请求最大文档数:单次请求允许的最大文档数量。对于 qwen3-vl-rerank 模型,该限制会根据文档类型(文本、图片、视频、混合模态)的不同而有所差异。
- 请求最大输入Token:计算公式为
Query Tokens × Document 数量 + Document Tokens 总和,该值不得超过请求最大输入Token。
输入格式限制:
模型 | 图片 | 视频 |
|---|---|---|
qwen3-vl-rerank | JPEG, PNG, WEBP, BMP, TIFF, ICO, DIB, ICNS, SGI(支持URL或Base64) | MP4, AVI, MOV(仅支持URL) |
前提条件
您需要已获取 API Key并配置API Key到环境变量DASHSCOPE_API_KEY。如果通过SDK调用,还需要安装DashScope SDK。
HTTP调用
不同模型使用不同的API接口:
- qwen3-rerank:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-api/v1/reranks - qwen3-vl-rerank / gte-rerank-v2:
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/rerank/text-rerank/text-rerank
{WorkspaceId}替换为真实的业务空间ID。
两种接口的请求体结构和响应格式不同,请参考对应模型的请求示例和响应示例。
请求请求头(Headers)Content-Typestring(必选)请求内容类型。此参数必须设置为application/json。Authorizationstring(必选)请求身份认证。接口使用阿里云百炼API Key进行身份认证。示例值:Bearer sk-xxxx。请求体(Request Body)modelstring(必选)模型名称。支持的模型:qwen3-rerank、gte-rerank-v2、qwen3-vl-rerank。inputobject(必选)输入内容。当使用
属性 query string | object(必选)查询内容。最大长度不能超过4,000个Token。当使用qwen3-vl-rerank模型时,query支持以下两种格式:
array(必选)待排序的候选文档列表。每个元素是一个字符串。当使用qwen3-vl-rerank模型时,每个元素是一个字典或者字符串,用于指定内容的类型和值。格式为{"模态类型": "输入字符串或图像、视频url"}。支持text, image, video三种模态类型。
object(可选)可选参数。当使用
属性 top_n int(可选)返回排序后的top_n个文档。默认返回全部文档。如果指定的值大于文档总数,将返回全部文档。return_documentsbool(可选)是否在排序结果中返回文档原文。默认值false,以减少网络传输开销。支持的模型:gte-rerank-v2、qwen3-vl-rerank。instruct string 可选添加自定义排序任务类型说明,仅在使用 qwen3-rerank 及qwen3-vl-rerank模型时生效。通过该参数可以指导模型采用不同的排序策略,例如:
float 可选仅qwen3-vl-rerank模型支持此参数。控制视频的帧数,比例越小,实际抽取的帧数越少,范围为 [0,1]。默认值为1.0。 |
|
响应request_idstring请求唯一标识。可用于请求明细溯源和问题排查。outputobject任务输出信息。当使用
属性 results array排序结果列表。按 relevance_score 从高到低排列。
属性 document dict文档原文对象。仅在请求参数 return_documents 为 true 时返回。结构为 {"text": "文档原文"}。indexint表示该结果对应于输入 documents 列表中的原始索引位置。relevance_scoredouble该文档与查询的语义相关性得分,取值范围为 0.0 到 1.0。分数越高,相关性越强。此分数为当前请求中的相对分数,主要用于对本次请求内的文档排序,不可作为跨请求比较的绝对值。 object输出信息统计。
属性 total_tokens int本次请求消耗的总 Token 数量。string请求失败的错误码。请求成功时不会返回此参数,详情请参见错误码。messagestring请求失败的详细信息。请求成功时不会返回此参数,详情请参见错误码。 |
|
SDK调用
调用示例
以下示例展示了调用文档排序模型API的代码示例。
SDK 的参数命名与HTTP接口基本一致,参数结构进行了一定封装。比如 HTTP 使用嵌套的input和parameters结构,但SDK 使用扁平参数。请在开发时注意区分。
qwen3-vl-rerank模型进行多模态排序(以图片作为查询)的代码示例。
输出示例
SDK对原始HTTP响应进行了封装,成功时会固定返回
code和message字段,值为空字符串。