基于版本对比、调试预览、用户反馈、优质评测数据,持续优化应用质量
应用优化支持多版本效果对比、基于调试结果与反馈优化 Prompt,以及基于优质评测数据优化 Prompt。本文介绍如何基于调试结果和人工反馈生成、审查并采纳优化后的 Prompt。
开始前,建议确认已创建应用并发布成功。同时准备能够暴露应用问题的测试问题,例如回答不完整、语气不符合预期、未遵循格式要求或存在合规风险的场景。
访问应用优化页面,点击选择需要优化的应用,发起应用优化任务。
在左侧提示词优化区域检查应用当前 Prompt,确认角色定位、任务目标、回答规则、边界条件和输出格式等基础信息完整。如需修改 Prompt,可直接在编辑区调整。
点击对比模式,打开版本对比调试弹窗。弹窗默认展示一组基准组和一组对照组,最多支持添加两组对照组。基准组与对照组的原始配置与当前应用草稿态配置一致,可点击右上角设置按钮查看基准组 Prompt、调整对照组 Prompt。
调整完成后,输入问题并发起调试任务,基准组与对照组会分别产出回复内容,可查看不同 Prompt 版本的回复差异。支持重复发起多轮调试,也可随时修改配置信息后继续调试。
确认最优版本的回复内容后,点击对应版本上的采纳当前组的配置项按钮,系统会将该组 Prompt 写入提示词编辑区。
在右侧调试窗口输入测试问题并发送,查看应用回答。建议优先测试真实业务中容易出现问题的场景,例如:
根据问题范围选择一条或多条调试结果:
点击根据调试结果优化 Prompt按钮,打开根据调试结果优化 Prompt窗口。
在人工评估的反馈中描述应用回答存在的问题和期望的改进方向。反馈应尽量具体,说明「哪里有问题」和「希望如何调整」。人工反馈用于补充调试对话中无法直接体现的业务要求。若选择了多条调试结果,可以在一段反馈中概括它们的共性问题和统一优化目标。
点击开始优化,系统将结合以下内容分析问题并生成新的 Prompt:
确认优化后的 Prompt 符合预期后,点击采纳,系统会将优化结果写入提示词编辑区。
采纳优化结果后,建议重新发起调试,并同时覆盖以下场景:
使用前准备
开始前,建议确认已创建应用并发布成功。同时准备能够暴露应用问题的测试问题,例如回答不完整、语气不符合预期、未遵循格式要求或存在合规风险的场景。
进入应用优化
访问应用优化页面,点击选择需要优化的应用,发起应用优化任务。
多版本对比优化
检查并完善当前 Prompt
在左侧提示词优化区域检查应用当前 Prompt,确认角色定位、任务目标、回答规则、边界条件和输出格式等基础信息完整。如需修改 Prompt,可直接在编辑区调整。
发起版本对比
点击对比模式,打开版本对比调试弹窗。弹窗默认展示一组基准组和一组对照组,最多支持添加两组对照组。基准组与对照组的原始配置与当前应用草稿态配置一致,可点击右上角设置按钮查看基准组 Prompt、调整对照组 Prompt。
版本对比调试
调整完成后,输入问题并发起调试任务,基准组与对照组会分别产出回复内容,可查看不同 Prompt 版本的回复差异。支持重复发起多轮调试,也可随时修改配置信息后继续调试。
配置项采纳
确认最优版本的回复内容后,点击对应版本上的采纳当前组的配置项按钮,系统会将该组 Prompt 写入提示词编辑区。
采纳仅更新当前编辑中的 Prompt,不会自动发布应用。采纳后仍可继续人工修改,或重新发起对比调试。
调试&反馈优化
发起调试对话
在右侧调试窗口输入测试问题并发送,查看应用回答。建议优先测试真实业务中容易出现问题的场景,例如:
- 回答遗漏规则、条件或例外情况。
- 回答语气生硬,不符合应用人设。
- 未按指定格式输出,内容冗长或结构混乱。
- 未遵循知识库内容,出现无依据回答。
- 缺少安全、合规或业务边界约束。
选择用于优化的调试结果
根据问题范围选择一条或多条调试结果:
- 选择一条结果:适合定位明确、可由一个案例说明的问题。优化窗口中显示「当轮调试结果」。
- 选择多条结果:适合多次出现或需要综合判断的问题。进入批量选择模式后,选择具有代表性的调试结果,优化窗口中显示「已选调试结果(N 条)」。
输入人工反馈
点击根据调试结果优化 Prompt按钮,打开根据调试结果优化 Prompt窗口。
在人工评估的反馈中描述应用回答存在的问题和期望的改进方向。反馈应尽量具体,说明「哪里有问题」和「希望如何调整」。人工反馈用于补充调试对话中无法直接体现的业务要求。若选择了多条调试结果,可以在一段反馈中概括它们的共性问题和统一优化目标。
生成并查看优化结果
点击开始优化,系统将结合以下内容分析问题并生成新的 Prompt:
- 应用当前 Prompt。
- 当轮或已选中的调试对话。
- 人工评估的反馈。
采纳优化结果
确认优化后的 Prompt 符合预期后,点击采纳,系统会将优化结果写入提示词编辑区。
采纳仅更新当前编辑中的 Prompt,不会自动发布应用。采纳后仍可继续人工修改,或重新选择调试结果再次优化。
验证并发布
采纳优化结果后,建议重新发起调试,并同时覆盖以下场景:
- 原问题场景:确认问题已得到解决。
- 正常场景:确认原有能力没有退化。
- 边界场景:确认异常输入、信息不足或冲突指令能够得到合理处理。
优化建议
- 一次聚焦一个主要问题:将内容完整性、语气、格式、合规等问题分批优化,更容易判断改动效果。
- 使用真实且有代表性的对话:优先将线上高频问题、评测失败样本整理为调试问题,或使用能够稳定复现问题的测试问题。
- 反馈使用明确约束:相比「回答得更好」,建议写明必须包含的内容、禁止出现的行为和期望的输出形式。
- 先采纳、再验证、后发布:不要仅根据优化后的文本判断效果,应通过调试验证实际回答质量。
- 保留人工复核:智能优化可能无法理解隐含业务规则,涉及知识口径、权限、安全与合规要求时应重点检查。
常见问题
采纳优化结果后,应用会立即生效吗?
采纳优化结果后,应用会立即生效吗?
不会。采纳操作仅将优化后的内容写入当前 Prompt,仍需完成调试验证并点击发布,新版本才会正式生效。
应该选择一条还是多条调试结果?
应该选择一条还是多条调试结果?
单一、明确的问题可选择一条结果;若同类问题在多个问题中重复出现,可选择多条结果帮助系统识别共性。多条结果应尽量围绕同一优化目标。
如何填写高质量的人工反馈?
如何填写高质量的人工反馈?
建议按照「问题现象 + 具体缺失或错误 + 期望行为」的方式填写。例如:「回答只说明了一般退款规则,遗漏家电类目例外;请完整列出一般规则、适用条件和特殊品类例外。」
优化后还需要重新调试吗?
优化后还需要重新调试吗?
需要。Prompt 改动可能影响其他回答场景。建议同时验证原问题、正常流程和边界输入,确认没有引入新的问题后再发布。