Skip to main content
数据连接

数据连接

数据连接是阿里云百炼平台管理外部数据源的统一入口。通过创建数据连接器,阿里云百炼应用可以安全地访问企业数据库、文档系统和对象存储中的数据,在对话中实时查询和引用这些数据。

连接器类型

数据连接器按数据的存储和访问方式,分为平台托管流处理两大类:

联通格式

连接器类型

数据存储方式

适用场景

平台托管

文件

阿里云百炼平台或自有OSS

上传和管理非结构化文档(PDF、Word、Markdown等)

表格

阿里云百炼平台或自有OSS

导入和查询结构化表格数据(CSV、Excel等)

流处理

MySQL

数据保留在原数据库,实时访问

连接MySQL数据库

执行SQL查询(仅DMS导入数据源方式支持执行)

PostgreSQL

数据保留在原数据库,实时访问

连接PostgreSQL数据库

执行SQL查询(仅DMS导入数据源方式支持执行)

PolarDB-X 2.0

数据保留在原数据库,实时访问

连接阿里云 PolarDB-X 2.0 分布式数据库

执行SQL查询(仅DMS导入数据源方式支持执行)

语雀

数据保留在语雀,实时访问

访问语雀文档和知识库

OSS

数据保留在OSS,实时访问

访问对象存储中的文件

前置条件

在创建数据连接器前,请确保满足以下条件:
  • 账号权限:主账号或具有数据连接管理权限的 RAM 用户。RAM 用户需要主账号授权后才能使用数据连接功能。授权方法请参见权限管理
  • 数据源准备:
    • 文件/表格连接器:已准备好要上传的文档或表格文件,或已创建OSS Bucket。
    • MySQL连接器:已有MySQL数据库实例(阿里云RDS或自建),并确保网络可达(公网或私网)。
    • PostgreSQL连接器:已有PostgreSQL数据库实例,且已将wal_level参数设置为logical
    • PolarDB-X 2.0连接器:已有阿里云 PolarDB-X 2.0 实例,且实例所在地域支持私网访问。如需通过 DMS 导入数据源,请先在 DMS 中完成 PolarDB-X 实例的录入。
    • 语雀连接器:已有语雀知识库(仅支持公网版本语雀),并获取了个人访问 Token。
    • OSS连接器:已创建OSS Bucket,并开通了向量检索服务

创建连接器

  1. 访问数据连接页面,单击右上角的创建连接器
  2. 选择连接器类型,填写基本信息和存储位置。
    • 文件连接器
    • 表格连接器
    • MySQL连接器
    • PostgreSQL连接器
    • PolarDB-X 2.0连接器
    • 语雀连接器
    • OSS连接器
    文件连接器用于管理非结构化文档(PDF、Word等)。
    1. 在创建连接器页面,连接器类型选择文件。
    2. 填写基本信息:
      1. 连接器名称:使用易于识别的名称。
      2. 描述:填写连接器的用途说明。描述会用于指导应用调用的准确度,建议写明数据内容和用途。
    3. 选择存储位置
      • 使用平台存储:数据存储在阿里云百炼平台提供的存储空间中,提供最大200,000个文件,1 TB 存储额度,限时免费
      • 使用自有OSS存储:数据存储在您自己的OSS Bucket中,适用于大规模数据存储。
        • 首次使用需按界面提示完成授权。
        • 目标 Bucket 需要添加bailian-connector-access标签(值为ReadAndWrite)以供阿里云百炼访问。添加标签
  3. 单击确认,完成创建。

导入数据

  • 导入文件
  • 导入表格
  • 导入OSS文件
  • 导入RDS MySQL数据
  • 导入自建MySQL数据
  • 导入自建PostgreSQL数据
点击文件连接器卡片详情,进入文件管理页面。
  1. 在左侧类目下,选择一个现有类目,或点击image图标新建类目。
    阿里云百炼通过类目管理导入的文件。
    每个业务空间最多可创建 500 个类目。如需扩充类目数量上限,请通过提交工单申请扩容。
  2. 点击导入数据,进入导入数据界面导入方式选择本地上传
    目前平台不支持直接导入JSON、CSV、YAML格式文件。请自行用相应工具将其转换为XLSX或XLS格式再导入。
  3. 解析方式可选默认设置自定义设置自定义设置可针对不同格式配置解析规则,以提升解析效果)。
    请根据实际需求配置解析策略,如不确定建议保持默认设置。有关文档智能解析大模型文档解析电子文档解析的详细说明,请参阅文档理解
    可选的解析方式取决于选择的文件类型(文档、图像、音频、视频)。
    • 电子文档解析:不支持解析文件中的插图与图表。
    • 文档智能解析:对于文件中的插图,解析器会识别并提取图中的文本,并生成文本摘要。这些摘要将与文件中其它非图片内容一起被切分并转换为向量,参与知识库的检索。
    • 大模型文档解析:使用选择模型模型的智能体应用支持用户对文件中插图和图表的内容进行提问。如需识别和理解文件中的插图与图表,请选择大模型文档解析
    • Qwen VL解析:仅支持解析图片格式。可自主选择千问VL模型,并通过传入Prompt指定模型需要识别的版面、元素及内容,其余功能与大模型文档解析一致。
    • 音视频解析:对文件进行语音识别、视频帧提取(仅限视频)和剧情解析(仅限视频),最终将所有声画信息按时间轴结构化对齐。
      • 语音识别:字幕内容解析器通过录音文件识别将人类语音转为文本。暂不支持识别音乐或自然环境声(如喇叭声、钟声、雷声等)。
      • 视频帧提取:从原始视频中抽取有代表性的视觉画面,并生成相应的文本描述。
      • 剧情解析(需手动开启):分析视频内容,定位具体事件并标注时间戳,同时生成相应的文本描述。
  4. 为文件配置标签(可选)。
    通过API调用应用时,可以在请求参数tags中指定标签。应用在检索知识库时,会先根据标签筛选相关文件,从而提高检索效率。对于智能体应用(Agent 1.0),可在控制台调试知识库时设置标签。
  5. 点击确认,系统将开始解析和导入,可在页面查看任务进度。
    文件将被转换成阿里云百炼可处理的格式。在请求高峰时段,该过程可能需要数小时,请耐心等待。
    在流量高峰或并发较高时,文件解析可能因资源排队而延长耗时,偶现解析超时,请耐心等待或稍后重试。
  6. 导入完成后,点击相应文件右侧的详情即可查看导入的文件。
    文件导入阿里云百炼后,将作为独立副本(与原始数据没有关联)存储在平台提供的免费空间中,当前无容量限制。
    仅支持查看最近90天内导入的文件。超过此时间范围后,导入的文件将无法查看,但不会被删除。
    导入的文件仅供当前业务空间的用户使用。阿里云百炼不会将其用于任何商业用途或对外公开。

查看连接器详情

连接器列表页,单击目标连接器的详情按钮,进入连接器详情页。详情页包含以下标签页:
  • 概览:显示连接器的基本信息(名称、描述、类型、创建时间、存储配额等)和自动生成的工具列表。
  • 文件/表格(仅平台托管类型):管理连接器中的文件或表格数据。
  • 工具:查看连接器自动生成的工具详情,包括参数说明和在线测试。
您可以在连接器详情页展开工具,填写参数后单击运行按钮,在线测试工具的返回结果。

同步数据规则

文件类型数据连接器文件页签下,可点击右上角的同步数据规则->创建同步规则进入页面创建规则。
  1. 选择数据同步的类目
  2. 选择数据同步来源
    • OSS
    • 飞书
    • 钉钉
    • SharePoint
    • 语雀同步
    通过阿里云服务关联角色(SLR)访问用户 Bucket,将 OSS 中的数据自动同步到百炼平台。
    • OSS 同步基于阿里云服务关联角色(SLR)访问用户 Bucket,无需配置 AccessKey。首次使用前请确保已初始化服务关联角色,按界面提示完成授权。
    • 对象路径列表需包含 Bucket 名称,例如:my-bucket/docs/my-bucket/docs/foo.md
    • 当前账号需具备目标 Bucket 的读取权限,且需要为目标 Bucket 添加bailian-datahub-access标签(值为read)以供阿里云百炼访问。参见管理存储空间标签
    填写以下 OSS 对象信息:

    参数

    是否必填

    说明

    OSS Region

    选择 OSS Bucket 所在的地域。可通过 OSS Region 一览查看支持的地域列表。

    OSS 对象路径

    输入需要同步的 OSS 对象路径,路径需包含 Bucket 名称。例如:my-bucket/docs/ 表示同步该目录下的所有文件;my-bucket/docs/foo.md 表示同步单个文件。

    同步周期

    选择数据自动同步的频率,例如一分钟。

    连接检测

    单击连接检测验证配置的 OSS 路径是否可正常访问。检测通过后方可提交规则。

    数据标签

    为同步的数据配置标签,便于后续分类管理。每个标签最多 32 个字符,支持中文、大小写英文字母、数字、下划线(_)和中划线(-)。输入后按回车确认添加。

  3. 配置数据标签,然后点击确认即创建成功。
创建完成后显示在同步规则列表页,可在操作列对规则开启启用禁用

文件连接器工具

文件连接器创建成功后,系统自动生成以下2个工具:

工具名称

功能说明

参数

searchFile

根据文件标题的关键词,查询文件列表,返回文件的下载链接。

  • keyWord(string,必填):文件标题的关键词。

  • maxCount(int,可选):返回文件数量,默认值为5,最大值为10。

getFile

根据文件ID,获取文件,返回文件的下载链接。

  • fileId(string,必填):文件ID。

管理连接器

  • 编辑:点击卡片进入连接器详情页,单击右上角的编辑按钮,可以修改连接器的名称描述。连接器类型和存储方式创建后不可更改。
  • 复制:在连接器列表页或详情页,单击复制按钮,可以基于当前连接器的配置快速创建一个新的连接器。
  • 删除:在连接器列表页,单击目标连接器卡片上的更多图标(···),选择删除;或在连接器详情页单击删除按钮。
    删除前需确认,删除后无法恢复
知识库创建后,不支持修改关联的数据连接,已有知识库编辑页的数据来源为只读字段。如需使用新的数据连接,需重新创建知识库。

在智能体中使用数据连接器

创建连接器后,在智能体应用中配置数据连接器工具,使智能体在对话中自动调用这些工具来查询和引用外部数据。
  1. 在智能体配置页面左侧,单击技能,找到数据连接器区域。
  2. 单击数据连接器区域的+按钮,在弹出的选择数据连接器对话框中:
    1. 浏览或搜索目标连接器,支持按连接器类型筛选。
    2. 单击目标连接器的添加按钮。
  • 添加后,连接器的工具会自动显示在配置列表中。您可以单击工具右侧的设置按钮调整参数。
  • 发布智能体,即可在对话中自动调用这些工具。

在工作流中使用数据连接器

创建连接器后,您可以在工作流应用中添加数据连接器节点,使工作流在执行过程中调用连接器工具来查询外部数据,并将结果传递给下游节点处理。
  1. 在工作流画布配置页面,展开左侧节点库,在工具分类下找到数据连接器,将其拖拽到画布中。
  2. 在弹出的选择数据连接器对话框中:
    • 浏览或搜索目标连接器,支持按连接器类型(文件、表格、MySQL、PostgreSQL、语雀、OSS)筛选。
    • 展开连接器,选择要使用的工具(如 searchFile、getFile),然后单击确定
  3. 配置节点输入:在节点配置面板的输入区域,为工具参数设置引用方式,将上游节点的输出或内置变量映射到工具所需的参数(如 fileId)。
  4. 连接节点:将数据连接器节点与上下游节点通过连线连接,确保数据流向正确。
  5. 节点输出为 result 对象,包含 content(Array<Object>,返回内容)和 isError(Boolean,是否发生错误)两个字段,供下游节点引用。
工作流中每个数据连接器节点只能关联一个工具。如需使用同一连接器的多个工具,请添加多个数据连接器节点。

相关文档

创建知识库导入数据源内容,用于后续检索:创建和使用知识库 应用配置和使用指南:应用类型介绍

常见问题

权限与安全

RAM用户需主账号授予管理员权限,参见页面权限
数据连接器在传输环节通过公网链路进行数据传输,但全程使用 HTTPS/TLS 加密通道,数据在传输过程中为密文状态,即使链路被截获也无法解读。数据到达平台后直接写入阿里云内网的安全存储,外部无法通过公网直接访问这些存储资源。公网在此仅承担传输介质的角色,数据不会在公网落盘。文件导入后,将作为独立副本(与原始数据没有关联)存储在平台提供的安全存储空间中。导入的文件仅供当前业务空间的用户使用,阿里云百炼不会将其用于任何商业用途或对外公开。如果您对公网传输仍有顾虑,可以选择以下方案进一步提升安全性:
  • 直接上传文件:通过文件连接器直接上传本地文件,数据全程不经过公网链路,直接写入阿里云内网的安全存储。
  • 使用私网数据源:对于阿里云 RDS MySQL 或自建 MySQL 数据库,可选择私网(VPC)方式进行连接,数据通过内网传输,在安全性和性能方面更具优势。详见上方私网数据源说明。
百炼知识库标准版与旗舰版在数据安全机制上完全一致:均具备用户级别隔离、仅限业务空间成员访问、传输采用 HTTPS/TLS 加密。两个版本的区别仅在于存储容量和功能上限,与安全性无关。

文件解析

在流量高峰或并发较高时,文件解析可能因资源排队而延长耗时,偶现解析超时。建议避开高峰时段重试,或耐心等待任务完成。

导入OSS文件

首次从OSS导入文件时,需要授权阿里云百炼访问OSS资源。主账号与子账号的授权流程不同。
  • 主账号授权
  • 子账号授权
  1. 在导入数据页面,点击前往授权
  2. 在弹出的对话框中,点击确认授权,系统将自动创建OSS服务关联角色,允许阿里云百炼访问OSS资源。
    通常秒级生效(高峰期可能延迟)。
  3. 为目标 OSS Bucket 添加bailian-datahub-access标签(值为read)。
    该标签用于标记阿里云百炼可访问的 Bucket,未标记的 Bucket 阿里云百炼无法访问。
    1. 访问OSS管理控制台,点击左侧导航栏中的Bucket 列表,找到目标 Bucket。
    2. 悬停鼠标在其image图标上,点击编辑(若未设置过标签)或前往编辑
    3. 在Bucket标签页面,点击创建标签(若未设置过标签)或设置
    4. 点击标签,添加标签名为bailian-datahub-access,标签值为read的标签,然后点击保存
  4. 返回导入数据页面,重新选择目标 Bucket 再尝试导入。
    注意:阿里云百炼不支持访问 Bucket 根目录下的文件,请选择已有的子目录或新建一个子目录供阿里云百炼访问。
该报错由以下原因引起,按顺序排查:
  1. 主账号未开通OSS服务。需主账号前往OSS管理控制台,按界面指引开通OSS。
  2. 目标OSS Bucket未添加bailian-datahub-access标签(值为read)。未添加该标签的Bucket阿里云百炼无法访问。前往OSS管理控制台Bucket标签页面,为目标Bucket添加标签。
  3. 完成上述操作后,返回阿里云百炼页面重新授权。

导入MySQL数据

  • 华东1(杭州)
  • 华东2(上海)
  • 华南1(深圳)
  • 华南2(河源)
  • 华南3(广州)
  • 华北1(青岛)
  • 华北2(北京)
  • 华北3(张家口)
  • 华北5(呼和浩特)
  • 华北6(乌兰察布)
  • 西南1(成都)
  1. 主账号为RAM用户配置如下三个系统策略:AliyunBailianFullAccessAliyunEventBridgeFullAccessAliyunRDSReadOnlyAccess。具体操作请参考管理RAM用户的权限
  2. 主账号为RAM用户配置创建服务关联角色系统策略。
    1. 使用主账号登录RAM控制台,在左侧导航栏,选择权限管理权限策略,然后点击页面上的创建权限策略
    2. 脚本编辑EffectActionResourceCondition中分别输入以下脚本中的对应内容后,点击确定
{
    "Version": "1",
    "Statement": [
        {
            "Action": "ram:CreateServiceLinkedRole",
            "Resource": "*",
            "Effect": "Allow"
        }
    ]
}
  1. 输入权限策略名称CreateServiceLinkedRole后,点击确定
  2. 在左侧导航栏,选择身份管理用户。从页面列表中找到待授权的RAM 用户,然后点击RAM 用户操作列的添加权限
  3. 权限策略列表中,选择刚创建的权限策略(CreateServiceLinkedRole),然后点击确认新增授权。至此,RAM 用户拥有了创建服务关联角色的权限。
  4. 完成以上步骤1和2后,返回创建数据源界面,使用RAM用户再尝试开通EventBridge服务关联角色
  • 阿里云RDS MySQL
  • 自建MySQL
上方仅为示意图,提示中的建议项和建议值会根据您表中数据量不同而不同。若无对应建议项,则无需调整。以下步骤请使用阿里云账号(主账号)操作。
  • 如何配置本地日志保留时长:
    1. 前往RDS控制台,点击左侧导航栏中的实例列表,然后点击包含该数据表的RDS实例。接着点击左侧导航栏中的备份恢复,再点击备份策略选项卡,即可看到保留时长设置项。
    2. 修改保留时长为提示中提供的建议值。
  • 如何配置wait_timeout:
    1. 前往RDS控制台,点击左侧导航栏中的实例列表,然后点击包含数据表的RDS实例。接着点击左侧导航栏中的参数设置,再点击可修改参数选项卡,即可看到wait_timeout设置项。
    2. 改为提示中提供的建议值。
这些报错表示您的MySQL数据库配置不满足数据连接器的前置要求。系统在创建数据源时会自动校验以下配置项:

报错代码

含义

期望值

CHECK_BINLOG_FORMAT

Binlog格式需要为ROW模式

binlog_format=ROW

CHECK_ENFORCE_GTID_MODE

需要开启GTID模式

gtid_mode=ON

CHECK_GTID_CONSISTENCY

需要开启GTID一致性约束

enforce_gtid_consistency=ON

解决方法:
  • 阿里云RDS MySQL
  • 自建MySQL
  1. 前往RDS控制台,点击左侧导航栏中的实例列表,然后点击目标RDS实例。
  2. 点击左侧导航栏中的参数设置,在可修改参数选项卡中,将以下参数修改为对应的期望值:
    • binlog_format设为ROW
    • gtid_mode设为ON
    • enforce_gtid_consistency设为ON
  3. 提交参数修改后,根据提示重启RDS实例使配置生效。
修改gtid_modeenforce_gtid_consistency需要重启实例。请在业务低峰期操作,避免影响在线业务。
Managed Agents
数据连接
Skill
应用评测
应用广场
权限管理