数据连接是阿里云百炼平台管理外部数据源的统一入口。通过创建数据连接器,阿里云百炼应用可以安全地访问企业数据库、文档系统和对象存储中的数据,在对话中实时查询和引用这些数据。
连接器类型
数据连接器按数据的存储和访问方式,分为平台托管和流处理两大类:
联通格式 | 连接器类型 | 数据存储方式 | 适用场景 |
|---|---|---|---|
平台托管 | 文件 | 阿里云百炼平台或自有OSS | 上传和管理非结构化文档(PDF、Word、Markdown等) |
表格 | 阿里云百炼平台或自有OSS | 导入和查询结构化表格数据(CSV、Excel等) | |
流处理 | MySQL | 数据保留在原数据库,实时访问 | 连接MySQL数据库 执行SQL查询(仅DMS导入数据源方式支持执行) |
PostgreSQL | 数据保留在原数据库,实时访问 | 连接PostgreSQL数据库 执行SQL查询(仅DMS导入数据源方式支持执行) | |
PolarDB-X 2.0 | 数据保留在原数据库,实时访问 | 连接阿里云 PolarDB-X 2.0 分布式数据库 执行SQL查询(仅DMS导入数据源方式支持执行) | |
语雀 | 数据保留在语雀,实时访问 | 访问语雀文档和知识库 | |
OSS | 数据保留在OSS,实时访问 | 访问对象存储中的文件 |
前置条件
在创建数据连接器前,请确保满足以下条件:
- 账号权限:主账号或具有数据连接管理权限的 RAM 用户。RAM 用户需要主账号授权后才能使用数据连接功能。授权方法请参见权限管理。
-
数据源准备:
- 文件/表格连接器:已准备好要上传的文档或表格文件,或已创建OSS Bucket。
- MySQL连接器:已有MySQL数据库实例(阿里云RDS或自建),并确保网络可达(公网或私网)。
- PostgreSQL连接器:已有PostgreSQL数据库实例,且已将
wal_level参数设置为logical。 - PolarDB-X 2.0连接器:已有阿里云 PolarDB-X 2.0 实例,且实例所在地域支持私网访问。如需通过 DMS 导入数据源,请先在 DMS 中完成 PolarDB-X 实例的录入。
- 语雀连接器:已有语雀知识库(仅支持公网版本语雀),并获取了个人访问 Token。
- OSS连接器:已创建OSS Bucket,并开通了向量检索服务。
创建连接器
- 访问数据连接页面,单击右上角的创建连接器。
-
选择连接器类型,填写基本信息和存储位置。
- 文件连接器
- 表格连接器
- MySQL连接器
- PostgreSQL连接器
- PolarDB-X 2.0连接器
- 语雀连接器
- OSS连接器
文件连接器用于管理非结构化文档(PDF、Word等)。- 在创建连接器页面,连接器类型选择文件。
-
填写基本信息:
- 连接器名称:使用易于识别的名称。
- 描述:填写连接器的用途说明。描述会用于指导应用调用的准确度,建议写明数据内容和用途。
-
选择存储位置:
- 使用平台存储:数据存储在阿里云百炼平台提供的存储空间中,提供最大200,000个文件,1 TB 存储额度,限时免费。
-
使用自有OSS存储:数据存储在您自己的OSS Bucket中,适用于大规模数据存储。
- 首次使用需按界面提示完成授权。
- 目标 Bucket 需要添加
bailian-connector-access标签(值为ReadAndWrite)以供阿里云百炼访问。添加标签
- 单击确认,完成创建。
导入数据
- 导入文件
- 导入表格
- 导入OSS文件
- 导入RDS MySQL数据
- 导入自建MySQL数据
- 导入自建PostgreSQL数据
-
在左侧类目下,选择一个现有类目,或点击
图标新建类目。
阿里云百炼通过类目管理导入的文件。
每个业务空间最多可创建 500 个类目。如需扩充类目数量上限,请通过提交工单申请扩容。 -
点击导入数据,进入导入数据界面。导入方式选择本地上传。
目前平台不支持直接导入JSON、CSV、YAML格式文件。请自行用相应工具将其转换为XLSX或XLS格式再导入。
-
解析方式可选默认设置或自定义设置(自定义设置可针对不同格式配置解析规则,以提升解析效果)。
解析方式说明
请根据实际需求配置解析策略,如不确定建议保持默认设置。有关文档智能解析、大模型文档解析和电子文档解析的详细说明,请参阅文档理解。可选的解析方式取决于选择的文件类型(文档、图像、音频、视频)。
- 电子文档解析:不支持解析文件中的插图与图表。
- 文档智能解析:对于文件中的插图,解析器会识别并提取图中的文本,并生成文本摘要。这些摘要将与文件中其它非图片内容一起被切分并转换为向量,参与知识库的检索。
- 大模型文档解析:使用选择模型模型的智能体应用支持用户对文件中插图和图表的内容进行提问。如需识别和理解文件中的插图与图表,请选择大模型文档解析。
- Qwen VL解析:仅支持解析图片格式。可自主选择千问VL模型,并通过传入Prompt指定模型需要识别的版面、元素及内容,其余功能与大模型文档解析一致。
-
音视频解析:对文件进行语音识别、视频帧提取(仅限视频)和剧情解析(仅限视频),最终将所有声画信息按时间轴结构化对齐。
- 语音识别:字幕内容解析器通过录音文件识别将人类语音转为文本。暂不支持识别音乐或自然环境声(如喇叭声、钟声、雷声等)。
- 视频帧提取:从原始视频中抽取有代表性的视觉画面,并生成相应的文本描述。
- 剧情解析(需手动开启):分析视频内容,定位具体事件并标注时间戳,同时生成相应的文本描述。
-
为文件配置标签(可选)。
通过API调用应用时,可以在请求参数
tags中指定标签。应用在检索知识库时,会先根据标签筛选相关文件,从而提高检索效率。对于智能体应用(Agent 1.0),可在控制台调试知识库时设置标签。 -
点击确认,系统将开始解析和导入,可在页面查看任务进度。
文件将被转换成阿里云百炼可处理的格式。在请求高峰时段,该过程可能需要数小时,请耐心等待。
在流量高峰或并发较高时,文件解析可能因资源排队而延长耗时,偶现解析超时,请耐心等待或稍后重试。
-
导入完成后,点击相应文件右侧的详情即可查看导入的文件。
文件导入阿里云百炼后,将作为独立副本(与原始数据没有关联)存储在平台提供的免费空间中,当前无容量限制。
仅支持查看最近90天内导入的文件。超过此时间范围后,导入的文件将无法查看,但不会被删除。
导入的文件仅供当前业务空间的用户使用。阿里云百炼不会将其用于任何商业用途或对外公开。
查看连接器详情
在连接器列表页,单击目标连接器的详情按钮,进入连接器详情页。详情页包含以下标签页:
- 概览:显示连接器的基本信息(名称、描述、类型、创建时间、存储配额等)和自动生成的工具列表。
- 文件/表格(仅平台托管类型):管理连接器中的文件或表格数据。
- 工具:查看连接器自动生成的工具详情,包括参数说明和在线测试。
同步数据规则
在文件类型数据连接器的文件页签下,可点击右上角的同步数据规则->创建同步规则进入页面创建规则。
- 选择数据同步的类目。
-
选择数据同步来源:
- OSS
- 飞书
- 钉钉
- 语雀同步
通过阿里云服务关联角色(SLR)访问用户 Bucket,将 OSS 中的数据自动同步到百炼平台。填写以下 OSS 对象信息:参数
是否必填
说明
OSS Region
是
选择 OSS Bucket 所在的地域。可通过 OSS Region 一览查看支持的地域列表。
OSS 对象路径
是
输入需要同步的 OSS 对象路径,路径需包含 Bucket 名称。例如:
my-bucket/docs/表示同步该目录下的所有文件;my-bucket/docs/foo.md表示同步单个文件。同步周期
是
选择数据自动同步的频率,例如一分钟。
连接检测
是
单击连接检测验证配置的 OSS 路径是否可正常访问。检测通过后方可提交规则。
数据标签
否
为同步的数据配置标签,便于后续分类管理。每个标签最多 32 个字符,支持中文、大小写英文字母、数字、下划线(_)和中划线(-)。输入后按回车确认添加。
- 配置数据标签,然后点击确认即创建成功。
文件连接器工具
文件连接器创建成功后,系统自动生成以下2个工具:
工具名称 | 功能说明 | 参数 |
|---|---|---|
| 根据文件标题的关键词,查询文件列表,返回文件的下载链接。 |
|
| 根据文件ID,获取文件,返回文件的下载链接。 |
|
管理连接器
- 编辑:点击卡片进入连接器详情页,单击右上角的编辑按钮,可以修改连接器的名称和描述。连接器类型和存储方式创建后不可更改。
- 复制:在连接器列表页或详情页,单击复制按钮,可以基于当前连接器的配置快速创建一个新的连接器。
-
删除:在连接器列表页,单击目标连接器卡片上的更多图标(
···),选择删除;或在连接器详情页单击删除按钮。
在智能体中使用数据连接器
创建连接器后,在智能体应用中配置数据连接器工具,使智能体在对话中自动调用这些工具来查询和引用外部数据。
- 在智能体配置页面左侧,单击技能,找到数据连接器区域。
-
单击数据连接器区域的+按钮,在弹出的选择数据连接器对话框中:
- 浏览或搜索目标连接器,支持按连接器类型筛选。
- 单击目标连接器的添加按钮。
- 添加后,连接器的工具会自动显示在配置列表中。您可以单击工具右侧的设置按钮调整参数。
- 发布智能体,即可在对话中自动调用这些工具。
在工作流中使用数据连接器
创建连接器后,您可以在工作流应用中添加数据连接器节点,使工作流在执行过程中调用连接器工具来查询外部数据,并将结果传递给下游节点处理。
- 在工作流画布配置页面,展开左侧节点库,在工具分类下找到数据连接器,将其拖拽到画布中。
-
在弹出的选择数据连接器对话框中:
- 浏览或搜索目标连接器,支持按连接器类型(文件、表格、MySQL、PostgreSQL、语雀、OSS)筛选。
- 展开连接器,选择要使用的工具(如 searchFile、getFile),然后单击确定。
- 配置节点输入:在节点配置面板的输入区域,为工具参数设置引用方式,将上游节点的输出或内置变量映射到工具所需的参数(如 fileId)。
- 连接节点:将数据连接器节点与上下游节点通过连线连接,确保数据流向正确。
- 节点输出为 result 对象,包含 content(Array<Object>,返回内容)和 isError(Boolean,是否发生错误)两个字段,供下游节点引用。
相关文档
创建知识库导入数据源内容,用于后续检索:创建和使用知识库。
应用配置和使用指南:应用类型介绍。
常见问题
权限与安全
创建知识库时上传保密文件到公网数据连接器是否存在安全风险?
创建知识库时上传保密文件到公网数据连接器是否存在安全风险?
- 直接上传文件:通过文件连接器直接上传本地文件,数据全程不经过公网链路,直接写入阿里云内网的安全存储。
- 使用私网数据源:对于阿里云 RDS MySQL 或自建 MySQL 数据库,可选择私网(VPC)方式进行连接,数据通过内网传输,在安全性和性能方面更具优势。详见上方私网数据源说明。
文件解析
文件解析耗时较长或偶现超时,如何处理?
文件解析耗时较长或偶现超时,如何处理?
导入OSS文件
从OSS导入文件配置说明
从OSS导入文件配置说明
- 主账号授权
- 子账号授权
- 在导入数据页面,点击前往授权。
-
在弹出的对话框中,点击确认授权,系统将自动创建OSS服务关联角色,允许阿里云百炼访问OSS资源。
通常秒级生效(高峰期可能延迟)。
-
为目标 OSS Bucket 添加
bailian-datahub-access标签(值为read)。该标签用于标记阿里云百炼可访问的 Bucket,未标记的 Bucket 阿里云百炼无法访问。
- 访问OSS管理控制台,点击左侧导航栏中的Bucket 列表,找到目标 Bucket。
- 悬停鼠标在其
图标上,点击编辑(若未设置过标签)或前往编辑。 - 在Bucket标签页面,点击创建标签(若未设置过标签)或设置。
- 点击标签,添加标签名为
bailian-datahub-access,标签值为read的标签,然后点击保存。
-
返回导入数据页面,重新选择目标 Bucket 再尝试导入。
注意:阿里云百炼不支持访问 Bucket 根目录下的文件,请选择已有的子目录或新建一个子目录供阿里云百炼访问。
导入OSS文件遇到“10041495”报错,应如何处理?
导入OSS文件遇到“10041495”报错,应如何处理?
导入MySQL数据
私网数据源支持哪些地域的RDS与ECS实例?
私网数据源支持哪些地域的RDS与ECS实例?
- 华东1(杭州)
- 华东2(上海)
- 华南1(深圳)
- 华南2(河源)
- 华南3(广州)
- 华北1(青岛)
- 华北2(北京)
- 华北3(张家口)
- 华北5(呼和浩特)
- 华北6(乌兰察布)
- 西南1(成都)
我想使用RAM用户开通EventBridge服务关联角色,应如何为该RAM用户配置权限?
我想使用RAM用户开通EventBridge服务关联角色,应如何为该RAM用户配置权限?
-
主账号为RAM用户配置如下三个系统策略:
AliyunBailianFullAccess、AliyunEventBridgeFullAccess和AliyunRDSReadOnlyAccess。具体操作请参考管理RAM用户的权限。 -
主账号为RAM用户配置创建服务关联角色系统策略。
- 使用主账号登录RAM控制台,在左侧导航栏,选择权限管理权限策略,然后点击页面上的创建权限策略。
- 在脚本编辑的
Effect、Action、Resource、Condition中分别输入以下脚本中的对应内容后,点击确定。
- 输入权限策略名称
CreateServiceLinkedRole后,点击确定。 - 在左侧导航栏,选择身份管理用户。从页面列表中找到待授权的RAM 用户,然后点击RAM 用户操作列的添加权限。
- 从权限策略列表中,选择刚创建的权限策略(CreateServiceLinkedRole),然后点击确认新增授权。至此,RAM 用户拥有了创建服务关联角色的权限。
- 完成以上步骤1和2后,返回创建数据源界面,使用RAM用户再尝试开通EventBridge服务关联角色。
系统提示“数据库配置校验不通过,您选择的表数据量较大”,应如何处理?
系统提示“数据库配置校验不通过,您选择的表数据量较大”,应如何处理?
- 阿里云RDS MySQL
- 自建MySQL
创建数据源时遇到CHECK_BINLOG_FORMAT、CHECK_ENFORCE_GTID_MODE或CHECK_GTID_CONSISTENCY报错,应如何处理?
创建数据源时遇到CHECK_BINLOG_FORMAT、CHECK_ENFORCE_GTID_MODE或CHECK_GTID_CONSISTENCY报错,应如何处理?
报错代码 | 含义 | 期望值 |
|---|---|---|
| Binlog格式需要为ROW模式 |
|
| 需要开启GTID模式 |
|
| 需要开启GTID一致性约束 |
|
- 阿里云RDS MySQL
- 自建MySQL
- 前往RDS控制台,点击左侧导航栏中的实例列表,然后点击目标RDS实例。
-
点击左侧导航栏中的参数设置,在可修改参数选项卡中,将以下参数修改为对应的期望值:
binlog_format设为ROWgtid_mode设为ONenforce_gtid_consistency设为ON
- 提交参数修改后,根据提示重启RDS实例使配置生效。
修改gtid_mode和enforce_gtid_consistency需要重启实例。请在业务低峰期操作,避免影响在线业务。
图标选择并上传文件(XLSX或XLS格式)。