Skip to main content
模型数据

日志回流

日志回流将 SLS(日志服务)推理日志转化为可用于模型微调或评测的结构化数据集。

功能概述

日志回流功能将 SLS(日志服务)中的推理日志数据回流到百炼平台,经过格式化处理后生成结构化数据集(JSONL 格式),可用于模型微调或模型评测。回流产出的是结构化数据,而非原始日志的直接副本。

支持范围

日志回流支持创建以下两类数据集:
  • 训练集:训练场景为文本生成,训练方式支持 SFT(监督微调)、DPO(直接偏好优化)和 CPT(持续预训练)。
  • 评测集:支持文本生成场景。
日志回流目前仅在华北2(北京)新加坡 Region 可用,其他 Region 不显示日志回流入口。单次回流上限为 10 万条,可多次回流到同一数据集的不同版本以积累更多数据。 日志回流支持平台存储(默认)和对象存储 OSS 挂载(需额外授权)两种存储方式。存储方式的差异和选择指引,请参见创建日志回流数据集 回流生成的数据集可直接用于下游任务:训练集可用于模型调优,评测集用于模型评测。数据也支持后续进行数据清洗

开通并授权相关服务

使用日志回流前,请确认当前 Region 为华北2(北京)或新加坡(其他 Region 不显示日志回流入口),并在模型监控页面完成以下服务开通和权限授权。全部完成后授权配置抽屉自动关闭,进入日志回流表单。
image

开启审计日志和推理日志

审计日志和推理日志各需完成三个步骤,共六个条件全部满足后才能使用日志回流。审计日志是推理日志的前置依赖,必须先完成审计日志的全部步骤。 审计日志
  1. 授权 SLS 服务关联角色:单击立即授权,授权 AliyunServiceRoleForSFMAccessSLS 角色。未授权时显示红色未授权标签。
  2. 开通 SLS 日志服务:未开通时显示未开通状态和跳转链接,单击后前往 SLS 控制台完成开通。
  3. 开启审计日志:单击创建并开启审计日志,系统创建 LogStore(日志库)实例并轮询等待就绪(最多 60 秒)。
推理日志
  1. 授权推理日志的 SLS 服务关联角色。
  2. 确认 SLS 日志服务已开通。
  3. 开启推理日志:审计日志未开启时该按钮置灰,需先完成审计日志开启。
开启必须按序:先审计日志,再推理日志。关闭必须反序:先关闭推理日志,再关闭审计日志。关闭日志后已有数据不可复原,操作前请确认不再需要日志数据。推理日志开启后 SLS 持续产生存储和读写费用,不再需要时应及时关闭。

OSS 多角色授权(仅 OSS 挂载模式)

选择 OSS 挂载存储方式时,需额外完成以下授权:
  1. 在弹出的授权弹窗中,勾选数据访问授权协议。
  2. 单击一键授权,系统自动授权以下两个服务关联角色:
    • AliyunServiceRoleForAccessCusOss(OSS 写入角色)
    • AliyunServiceRoleForSFMDataHubOSSImport(DataHub 导入角色)
下表汇总了日志回流涉及的服务关联角色。

角色名称

用途

授权时机

AliyunServiceRoleForSFMAccessSLS

百炼访问 SLS 日志数据

审计日志和推理日志各授权一次

AliyunServiceRoleForAccessCusOss

OSS 数据写入

选择 OSS 挂载存储时

AliyunServiceRoleForSFMDataHubOSSImport

DataHub 数据导入

选择 OSS 挂载存储时

创建日志回流数据集

日志回流提供三个入口,均可进入配置表单创建数据集:
  • 模型监控列表页
  • 模型监控详情页
  • 数据管理页
模型监控列表页顶部,单击日志回流。首次使用时先完成授权配置,授权通过后自动展示日志回流表单。
image

配置回流参数

进入日志回流表单后,按从上到下的顺序配置以下参数。部分参数有前置依赖:API Key 过滤需先选时间范围,模型选择需先选时间范围和 API Key。修改时间范围、数据类型、训练场景或训练方式会联动重置其他参数,建议严格按顺序填写。各参数取值说明见下表。
image
预估日志回流数据:系统根据筛选条件显示预估的回流数据条数。超过 10 万条时红色警告,超出部分不会被回流。查询结果过多时,确定按钮禁用,需缩小筛选范围。
表单联动重置规则:修改时间范围会重置 API Key(回到全部)和模型选择(清空);修改数据类型、训练场景或训练方式会重置存储位置和导入方式。
存储方式、数据类型和训练方式在创建后均不可更改,选择前请仔细确认。

参数

说明

是否必填

取值说明

回流位置

数据集的存储方式

平台存储(默认)或 OSS 挂载。评测集时 OSS 挂载禁用。创建后不可更改

数据集名称

数据集在列表中的显示名称

中文、英文、数字、下划线、斜杠、连字符,最大 50 字符。建议采用 功能场景_模型名_时间 格式命名。创建后不可修改

数据集描述

数据集用途补充说明

最大 200 字符

类型与格式

数据集用途类型

训练集或评测集。选择评测集时训练场景和训练方式隐藏。创建后不可更改

训练场景

训练场景类型(仅训练集显示)

当前仅支持文本生成

训练方式

微调方法(仅训练集显示)

SFT、DPO、CPT,选项由系统动态展示。创建后锁定

时间范围

回流日志的时间段

最近 30 天(含当天),精确到时分秒。修改会重置 API Key 和模型选择

API Key 过滤

按 API Key 筛选日志数据

全部(不过滤)、其他(排除已列出 Key)、或选择具体 Key(多选)

模型选择

回流目标模型

最多 10 个,按能力类型过滤不匹配模型置灰

OSS 数据路径

数据存储的目标目录(仅 OSS 挂载模式显示)

Bucket 需在同一 Region

查看回流结果

提交日志回流任务后,在数据管理列表页查看数据集和导入进度。
image

列表页展示

日志回流创建的数据集在列表页中的导入方式显示为日志回流,存储位置根据创建时的选择显示为平台存储OSS 挂载 可在列表页查看任务的导入状态。任务失败时,可查看系统返回的具体失败原因。 平台存储模式下,导入完成后系统自动发布数据集版本,无需手动操作。

详情页信息

数据集详情页展示的信息根据存储方式有所不同:
  • OSS 挂载:展示发布状态、数据量、创建时间、FileID、数据类型、导入状态和 OSS 挂载地址。
  • 平台存储(OSS 导入):展示发布状态、数据量、创建时间、FileID、数据类型、导入状态和 OSS 导入地址。
  • 其他情况:展示发布状态、数据量、创建时间、FileID、数据类型和导入状态。

追加日志回流数据

数据管理页面,向已有数据集追加新一批日志回流数据,有以下两种方式:
  • 导入数据页
  • 新增版本弹窗
进入已有数据集的导入数据页面,选择日志回流作为导入方式。表单参数与创建流程一致,详见创建日志回流数据集。此方式额外支持按工作空间过滤。此方式适用于所有存储类型的数据集,包括 OSS 挂载数据集。

增量回流最佳实践

推荐分批次回流,针对不同时段或不同模型分别执行回流任务,逐步积累高质量训练集。每批次可精准选择表现良好的模型和业务高峰时段的数据,确保数据质量优于一次性大量回流。

常见问题

问题:API Key 过滤中其他包含哪些请求?其他过滤掉已列出 Key 的请求,包含已删除的 Key 或其他工作空间产生的日志。全部则不按 Key 过滤。三种模式(全部/其他/逐个选择)的完整说明见创建日志回流数据集的 API Key 过滤参数。
问题:单次回流上限 10 万条,是否意味着数据集总量也被限制在 10 万条?不是。10 万条是单次回流的上限,并非数据集的总量上限。可以多次回流到同一数据集的不同版本,累计数据量不受此限制。例如分批次针对不同时段回流,每次 10 万条以内,最终数据集可以积累远超 10 万条的数据。
问题:两种存储方式除了数据存储位置不同,还有哪些差异?两种存储方式的核心差异对比如下。

维度

平台存储

OSS 挂载

额外授权

无需额外授权

需授权两个服务关联角色并勾选数据访问协议

新增版本

支持

不支持(按钮置灰),需通过导入数据页追加

数据访问

通过控制台访问

可在 OSS Bucket 直接查看和管理 JSONL 文件

评测集

支持

不支持(选项禁用)

自动发布

导入完成后自动发布版本

不自动发布

问题:开启日志需要分别操作审计日志和推理日志,两者有什么关系?两者需分别开启,且必须先完成审计日志才能开启推理日志。操作步骤详见开通并授权相关服务
问题:提交前显示的预估数据量与回流完成后的实际条数有差异。预估数据量是基于筛选条件的近似估算值,实际回流完成后的数据条数可能略有差异,这是正常现象。预估值用于帮助判断是否需要调整筛选条件(如超过 10 万条时提示缩小范围),不代表精确计数。
Token Plan
模型体验
  • 3D模型生成
  • 音乐生成
模型调优
模型压缩目录节点
用量统计与性能监控
资产中心
服务支持