数据集是模型训练与评测的基础,阿里云百炼数据管理功能可以帮助您高效地创建和管理数据集。
数据集概述
阿里云百炼数据管理功能对您业务空间下所有大模型相关数据集进行统一管理。数据集分为训练集(用于模型调优,支持 SFT/DPO/CPT)和评测集(用于模型评测两类。
训练集支持4种训练场景:文本生成、多模态理解、图生视频(首帧)、图生视频(首尾帧);评测集仅支持文本生成场景。数据集类型创建后不可变更,请根据下游用途谨慎选择。
数据集名称最长50字符(支持中文、英文、数字、下划线、连字符和点),描述最长200字符。不支持创建或发布空数据集。数据集创建数量无限制,导入数据量无上限。
DPO/CPT 训练方法、云存储挂载仅支持北京地域。
训练方法与场景
训练集支持三种训练方法,适用场景和最低数据量要求不同:
- SFT(监督微调):指令微调,使模型学会解决特定任务。建议数据量上千条。全部站点可用。
- DPO(直接偏好优化):偏好对齐训练。建议数据量上百条。
- CPT(持续预训练):领域知识注入。建议数据量至少 5000 万 Token。
训练方法 | 用途 | 推荐数据量 | 站点可用性 |
|---|---|---|---|
SFT | 监督微调(指令微调) | 上千条 | 全部站点 |
DPO | 直接偏好优化(偏好对齐) | 上百条 | 北京地域 |
CPT | 持续预训练(领域知识) | 5000万 Token | 北京地域 |
导入方式
数据集支持三种导入方式,适用场景和前置条件不同:
- 本地上传:无前置条件,直接上传本地文件,适合小批量数据。
- OSS 导入:需在目标 Bucket 添加标签
bailian-datahub-access=read,适合大批量数据。评测集不支持此方式。 - 日志回流:从 SLS 推理日志自动提取训练数据,需授权服务关联角色,形成推理→数据→微调增强回路。
导入方式 | 前置条件 | 适用场景 | 评测集支持 |
|---|---|---|---|
本地上传 | 无 | 小批量数据 | 支持 |
OSS 导入 | Bucket 标签 bailian-datahub-access=read | 大批量数据 | 不支持 |
日志回流 | 授权 + API Key/模型筛选 | 从推理日志构建训练数据 | 支持 |
数据准备
准备高质量数据是模型调优效果的关键。各训练方式(SFT/DPO/CPT 文本生成)的推荐数据量详见调优数据上传规则。
多模态理解和图生视频训练集暂无官方推荐数据量,建议根据实际场景准备充足样本。
数据格式与模板
各训练场景(SFT 文本/多模态理解(图/视频→文本)、DPO、CPT、评测集)的数据文件格式规格详见调优数据上传规则。
建议在数据管理创建数据集页面下载对应场景的数据模板,按模板结构准备数据可避免导入失败。
数据多样性和扩充策略请参考模型调优文档。评测集应准备一份数据不重叠的独立集合,用于客观评估模型泛化能力。
创建数据集
创建数据集前需满足以下前提条件:已开通百炼服务;OSS 导入需在目标 Bucket 添加标签 bailian-datahub-access=read;日志回流需授权服务关联角色。
在数据管理 > 数据集列表页,点击新增数据集,按以下步骤操作:
- 填写数据集名称(最长50字符)和描述(最长200字符,可选)。
- 选择数据集类型:训练集或评测集(创建后不可变更)。
- 选择训练场景:文本生成、多模态理解、图生视频(首帧)、图生视频(首尾帧)。评测集仅支持文本生成。
- 选择训练方法:SFT、DPO、CPT。
- 选择存储位置:平台 OSS 存储(免费,无数据量上限)或云存储挂载(评测集不可用)。
- 选择导入方式并上传数据:本地上传、OSS 导入、日志回流(详见下方分 Tab 说明)。
- 点击提交后数据集立即发布,完成创建。
参数 | 说明 | 是否必填 | 取值说明 |
|---|---|---|---|
数据集名称 | 数据集标识 | true | 最长50字符,中文/英文/数字/下划线/连字符/点 |
数据集描述 | 数据集说明 | 最长200字符 | |
数据集类型 | 训练集或评测集,创建后不可变更 | true | 训练集/评测集 |
训练场景 | 数据适用的训练场景 | true | 文本生成/多模态理解/图生视频(首帧)/图生视频(首尾帧) |
训练方法 | 训练算法类型 | true | SFT/DPO/CPT |
存储位置 | 数据集存储方式 | true | 平台OSS存储/云存储挂载 |
导入方式 | 数据导入来源 | true | 本地上传/OSS导入/日志回流 |

- 本地上传
- OSS 导入
- 日志回流
点击上传文件选择本地数据文件,SFT 文本生成和 DPO 文本生成支持多文件上传。文件格式需符合场景要求(详见数据准备章节),导入数据自动启用 SSE-OSS 加密。
版本管理
同一数据集可有多个独立版本,版本号自动递增。在数据集详情页点击新增版本可创建新版本。
新增版本采用新建模式,需重新导入全部数据,不再支持基于上一版本数据增量修改的继承模式。
- 新建模式:重新导入全部数据,适合大规模更新。
数据集管理
在数据管理 > 数据集列表页可查看所有数据集,支持按类型(训练集/评测集)筛选和按名称搜索。导入中的数据集每 5 秒自动刷新状态,无需手动刷新。
发布与删除
发布操作不可逆,发布后的版本不可再编辑。已发布版本的删除同样不可逆,仅历史创建的草稿版本可删除;删除整个数据集会移除其下所有版本,操作均不可恢复,请谨慎执行。
编辑与导出
只有历史创建的草稿版本可在线编辑(可编辑 Prompt/Completion 内容),新建数据集提交即发布、不再产生草稿版本;已发布版本编辑功能不可用。导出数据集时各类型格式不同:SFT 训练集导出为 jsonl,多模态训练集导出为 zip,评测集导出为 xlsx,不支持导出空数据集。

计费说明
数据管理功能本身免费,但数据集存储和下游资源会产生费用,具体以百炼计费页面为准。
- 平台 OSS 存储:费用以百炼计费页面为准。
- 云存储挂载:费用归属用户自有 OSS 账单。
- 日志回流:产生的 SLS 费用归属 SLS 产品账单。