评测集用于存储和管理所有评测任务数据,可通过自动生成或手动上传的方式创建。当前支持对话分析和知识问答两种评测集类型。
评测集类型
对话分析
-
支持的文件格式:
.xls、.xlsx。 -
字段说明:
字段
说明
Prompt
用户的输入,通常是一个问题或一个指令。
Completion
针对 Prompt 的参考答案,用于评估模型实际生成的回答。
SessionId
用于标识一个完整的对话会话(Session)。具有相同
SessionId的多行数据将被视为一个连续的多轮对话。 -
示例:
Prompt(user)
Completion(assistant)
SessionId
说明
亚运会在哪个城市举行?
杭州。
49aa5bc0-76de-471d-9f50-c8f7710bbc9d
多轮对话 - 第1轮
哪年举行?
2023年
49aa5bc0-76de-471d-9f50-c8f7710bbc9d
多轮对话 - 第2轮
知识问答
-
支持的文件格式:
.jsonl。 -
字段说明:
字段
说明
query
智能体接收的用户输入问题。
queryType
问题分类标签,如事实型、分析型、比较型、教程型等,支持自定义其他类型。
referenceAnswer
标准答案,用于评估回答的准确性、完整性和相关性。
fineKeywords
细粒度关键词,答案应包含的具体信息点(嵌套列表格式)。
coarseKeywords
粗粒度关键词,核心主题词,通常 1-3 个。
-
coarseKeywords(粗粒度关键词)
- 含义与作用:代表查询的核心主题词(1-3个),用于判断检索内容是否存在主题偏离。
- 示例:
["外滩", "浦东"]
-
fineKeywords(细粒度关键词)
- 含义与作用:构成标准答案所必需的关键信息点,用于评估回答的信息完整性。
- 格式与示例:采用嵌套数组
[[ ]]格式,每个子数组[ ]代表一个独立信息点。
-
coarseKeywords(粗粒度关键词)
- 示例:
创建评测集
自动生成
基于大模型,依据指定的知识库自动生成评测集。仅支持生成知识问答类型的评测任务,详情请参考自动评测。
手动上传
手动上传支持对话分析和知识问答两种类型的评测集。
-
准备评测集文件,格式要求如下:
评测集类型
文件格式
说明
对话分析
.xls、.xlsx单次上传最多支持 10 个文件,单个文件不超过 20MB。
知识问答
.jsonl单次上传最多支持 10 个文件,单个文件不超过 20MB。
- 进入评测集页面,单击页面右上角创建评测集。
- 输入评测集名称,选择评测集类型,上传评测集文件,单击确认。
修改并发布评测集
- 进入评测集页面,点击右侧的查看进入评测集详情页。
-
如果需要修改评测集内容,单击右上角增量导入,支持如下修改方式:
- 单条新增: 手动添加一条新的评测数据。
- 批量导入: 通过上传文件一次性向评测集中追加多条新数据。上传文件的格式和字段要求必须与当前评测集类型一致。
- 全量覆盖: 导入全新的评测集文件,完全覆盖当前数据。上传文件的格式和字段要求必须与当前评测集类型一致。
- 完成修改后,单击发布确认发布,即可将修改后的评测集发布为新的版本。