DashScopeParse是专门用于高效地解析和表示文件的解析器,以便通过LlamaIndex框架进行高效检索和上下文增强。目前使用的解析服务来自于阿里云 “文档智能(Document Mind)” 。
开始
前提条件
首先,登录https://bailian.console.aliyun.com/,获取你的API-KEY,当需要指定业务空间时也要获取指定“业务空间id”。
- 已创建API-KEY:获取与配置 API Key。
- 已创建业务空间:业务空间管理。
示例代码
现在你可以使用下面的代码获取PDF文件的解析结果了:
- 目前只支持.doc、.docx、.pdf,大小在100M以内且文件页数在1000以内的文件上传、解析。
- DASHSCOPE_API_KEY:是必须指定的API-KEY。
- DASHSCOPE_WORKSPACE_ID:如果使用默认业务空间,可以不指定。如果需要指定业务空间,请指定“业务空间id”。
返回结果
结果为Documents对象,json化内容为:(只示例重点字段,其中text字段由于长度过长,所以做了省略显示)
参数说明
输入参数
参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
result_type | Enum | ResultType.DASHSCOPE_DOCMIND | Parser解析结果的类型 |
num_workers | int | 4 | 处理多个文件时发起API请求的worker数量 |
check_interval | int | 5 | 查询解析状态是的间隔,单位:秒 |
max_timeout | int | 3600 | 解析超时时间,单位:秒 |
workspace | str | None | DashScope workspace id |
api_key | str | None | DashScope api key,可以通过环境变量等方法设置。 |
category_id | str | default | 指定上传的类目ID |
输出Document对象字段说明
字段名 | 字段类型 | 字段描述 |
id_ | str | 系统生成的文档id |
metadata.parse_fmt_type | str | 解析结果格式化类型 |
text | str | 解析结果字符串,为JSON转义的结果,如果是python语言可以使用json.loads(text) |