数据挖掘模型专门针对信息抽取、内容审核、分类打标和摘要生成任务进行设计。相比通用对话模型,该模型能够快速且精确地输出规范的结构化数据(如JSON格式),解决通用对话模型返回不规范回复结构或提取信息不够准确的问题。 此外,该模型还支持基于文档内容生成PPT,提供模板模式和创意模式两种方式。
本文档仅适用于华北2(北京)地域。如需使用模型,需使用华北2(北京)地域的API Key。
使用方式
Qwen-Doc-Turbo 支持通过以下三种方式从文件中提取信息,具体文件大小与类型限制请参考限制:
特性 | 文件URL (推荐) | 文件ID | 纯文本 |
|---|---|---|---|
文件来源 | 公网 URL | 本地文件 (需先上传) | 字符串传入 |
输入长度限制 | 最多10个文件 | 1个文件 | 9,000 Token以内 |
SDK 兼容性 | 仅限 | 上传: |
|
核心优点 | 无需上传至百炼,支持指定文件的解析方式 | 避免重复上传,适合复用 | 无需文件管理 |
PPT生成 | 仅创意模式支持(1个文件) | 仅创意模式支持(1个文件) | 创意和模板模式均支持 |
前提条件
- 已获取与配置 API Key,并配置API Key到环境变量。
- 如果通过SDK调用,还需要安装OpenAI SDK或DashScope SDK。
通过文件URL传入
通过文件URL直接提取结构化数据,支持最多10个文件同时处理。此处以传入示例产品手册A与示例产品手册B文件并通过提示词约束模型以JSON格式返回所提取信息为例。
文件URL方式当前仅支持DashScope协议,可以选择使用DashScope Python SDK或者HTTP方式调用(如curl)
响应示例
响应示例
模型返回的
response.output.choices[0].message.content 字段可能包含 Markdown 代码块标记(如 ```json 和 ``` 包裹)。在使用 json.loads() 解析前,需先去除 Markdown 标记。示例处理方式:通过文件ID传入
上传文件
在运行以下代码前,请先点击示例产品手册A下载文件,并将其放置在项目代码所在的目录中。通过OpenAI兼容接口上传到阿里云百炼平台的安全存储空间,获取返回的file-id。有关文件上传接口的详细参数解释及调用方式,请参考API文档页面进行了解。
Python
file-id。
通过文件ID传入信息并对话
将获取的 file-id 嵌入到System Message 中。第一条System Message用于设定角色向模型提问,后续的System Message用于传入 file-id,User Message包含针对文件的具体问题。
完整示例:上传文件并调用模型
完整示例:上传文件并调用模型
响应示例
响应示例
模型返回的
response.output.choices[0].message.content 字段可能包含 Markdown 代码块标记(如 ```json 和 ``` 包裹)。在使用 json.loads() 解析前,需先去除 Markdown 标记。示例处理方式:通过纯文本传入
除了通过 file-id 传入文件信息外,您还可以直接使用字符串传入文件内容。在此方法下,为避免模型混淆角色设定与文件内容,请确保在 messages 的第一条消息中添加用于角色设定的信息。
受限于API调用请求体大小,如果您的文本内容长度超过9,000Token,请通过文件URL或文件ID传入信息对话。
响应示例
响应示例
模型返回的
response.output.choices[0].message.content 字段可能包含 Markdown 代码块标记(如 ```json 和 ``` 包裹)。在使用 json.loads() 解析前,需先去除 Markdown 标记。示例处理方式:生成PPT
Qwen-Doc-Turbo支持基于文档内容生成PPT,提供以下两种模式:
-
模板模式(general,默认):基于预设模板生成PPT,适用于结构化报告、新闻资讯等场景。不传
mode参数时默认使用该模式。 仅支持通过system message传入文档内容。 - 创意模式(creative):无需模板,自动设计排版并生成图版PPT(每页为图片),适用于需要丰富视觉效果的场景。 支持system message、doc_url和file_id三种输入方式,每次仅支持传入单个文档。
PPT生成功能仅在流式输出时有效,非流式调用会报错
The parameter skill is only supported in stream mode。- 模板模式
- 创意模式
可选的PPT模板如下:
news_01:新闻模板summary_01:总结模板internet_01:互联网模板thesis_01:论文模板
skill指定type为ppt和template_id。模板模式支持OpenAI兼容和DashScope两种SDK。- OpenAI兼容
- DashScope
输出说明
流式输出,分为以下三个阶段:- 大纲生成:模型根据文档内容生成PPT大纲,输出在
reasoning_content字段中。 - 页面HTML生成:模型逐页生成HTML格式的页面,每页为一个完整的HTML文档,输出在
reasoning_content字段。 - 最终PPT文件:生成完成后,PPT文件的下载链接输出在
content字段中。
模型定价
模型名称 | 上下文长度 | 最大输入 | 最大输出 | 输入成本 | 输出成本 | 免费额度 |
|---|---|---|---|---|---|---|
(Token数) | (每千Token) | |||||
qwen-doc-turbo | 262,144 | 253,952 | 32,768 | 0.0006元 | 0.001元 | 无免费额度 |
PPT生成计量方式
PPT生成功能的Token计量方式如下:
- input_tokens:用户输入Token数 + 大纲生成的输入Token数。
- output_tokens:大纲生成的输出Token数。
- total_tokens:input_tokens + output_tokens。
常见问题
- 通过OpenAI文件兼容接口上传文件后,文件将被保存在何处? 所有通过OpenAI文件兼容接口上传的文件均将被保存在当前阿里云账号下的阿里云百炼存储空间且不会产生任何费用,关于所上传文件的信息查询与管理请参考OpenAI文件接口。
- 文件ID是否可以用于其他模型对话或功能调用? 文件ID目前仅能用于Qwen-Long、Qwen-Doc-Turbo模型对话以及Batch接口批量调用。
- 通过文件URL方式上传时,文件解析策略(file_parsing_strategy)参数有什么不同? 当解析策略设置为 "auto" 时,系统会根据文件内容自动进行解析;当解析策略设置为 "text_only" 时,系统将仅解析文字类内容;当解析策略设置为“text_and_images”时,系统将会解析所有图片与文本类内容,解析所需时间也会相应增加。
-
如何确定文件已经解析完成?
获取 file-id 后,您可以直接尝试使用该ID与模型进行对话。如果文件仍在解析中,API会返回相应的错误提示
File parsing in progress, please try again later.,此时请稍后重试。如果模型调用成功并返回了回复,则表示文件已解析完成,可以正常使用。 - 文件上传后的解析过程是否会产生任何额外费用? 文档解析并不会产生任何额外费用。
- 生成PPT是否会产生额外费用? PPT生成不会产生额外费用。费用按Token用量计算:输入Token数为您传入的文档内容Token数与模型生成大纲消耗的输入Token数之和,输出Token数为模型生成大纲的输出Token数,图片渲染和PPT文件生成不计费。
API参考
关于Qwen-Doc-Turbo的输入与输出参数,请参考OpenAI 兼容API详情或DashScope API详情
错误码
如果模型调用失败并返回报错信息,请参见错误码进行解决。
限制
-
SDK 依赖:
- 文件URL (doc_url): 文件URL方式当前仅支持DashScope协议,可以选择使用
DashScope Python SDK或者HTTP方式调用(如curl) - 上传文件 (file-id): 文件上传与管理操作 必须 使用
OpenAI兼容 SDK。
- 文件URL (doc_url): 文件URL方式当前仅支持DashScope协议,可以选择使用
-
文件上传与引用:
-
文件URL (
doc_url): 单次请求最多支持 10 个文件URL,且传入的URL需确保公网可访问。 -
上传文件 (
file-id): 单个文件不超过 150MB。单个阿里云账号最多可上传 1 万个文件,总大小不超过 100GB,当前暂无有效期限制。单次请求最多引用 1 个文件。使用文件ID传入时,当文件数量或总大小达到任一上限时,新的文件上传请求将会失败。请参考OpenAI兼容-File,及时删除不再需要的文件以释放配额,然后才能继续上传。
- 支持格式:TXT, DOC, DOCX, PDF, XLS, XLSX, MD, PPT, PPTX, JPG, JPEG, PNG, GIF, BMP。
-
文件URL (
-
API 输入:
- 通过
doc_url或file-id引入信息时,上下文长度上限为 262,144 Token。 - 直接在
user或system消息中输入纯文本时,单条消息内容限制在 9,000 Token 以内。
- 通过
-
API 输出:
- 最大输出长度为 32,768 Token。
-
文件共享:
file-id仅在生成它的阿里云主账号内有效,不支持跨账号或通过 RAM 用户 API Key 调用。
- 限流:关于模型的限流条件,请参见限流。