名词解释
直通链路:是指不通过语音识别(ASR)、意图识别、语音合成(TTS)等节点,直接将请求送入Agent,并将Agent的回答直接返回的链路。
适用场景
将图片直接送入Agent进行识别,无需意图检测及语音链路,适用于带摄像头产品的图片理解、拍学机或学习机内的拍照识图等功能。
前提条件
开通阿里云百炼模型服务并获取API KEY
请参考获取与配置 API Key,API KEY作为百炼模型服务的鉴权凭证。
管控台开通拍照问答直通链路
- 在多模态开发套件中创建多模态交互应用,模版选择全能版本(不要选择视觉版),关闭语音交互。
- 关闭 对话承接语、知识库、联网搜索、长期记忆配置。
- 技能配置全部清空、Agent配置只保留拍照问答。
- 配置拍照问答Agent,启动指令置空,模型推荐选择“视觉理解均衡版”,请按需要配置提示词。
- 配置完成后请点击右上角发布按键进行发布(必须发布后才能测试)。
HTTP协议接入
请求参数说明
一级参数 | 二级参数 | 类型 | 是否必选 | 说明 |
model | string | 是 | 阿里云百炼模型名称,固定为"multimodal-dialog",请直接复制使用 | |
input | directive | string | 是 | 指令名称:Request |
app_id | string | 是 | 客户创建的应用ID(获取APP ID),可在多模态交互开发套件控制台的“我的应用”页面查看 | |
dialog_id | string | 否 | 对话id,默认不填时是新对话,服务端会自动生成并在返回结果中下发,格式示例:"12345678-1234-1234-1234-1234567890ab",共36个字符。当希望继续之前的对话时,把当时服务端下发的dialog_id在这里传入 | |
text | string | 是 | 要处理的文本。注意,在本实践中没有文本请置为""空字符串。 | |
parameters | client_info | object | 是 | 参数说明参考下方 parameters.client_info的参数说明表格 |
images | list[] | 否 | 需要分析的图片数据,仅多模态应用可支持图片问答,参数说明参考下方parameters.images的参数说明表格 | |
biz_params | object | 否 | 按需配置,参数说明参考下方parameters.biz_params的参数说明表格 |
parameters.client_info的参数说明
一级参数 | 二级参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|---|
user_id | string | 是 | 终端用户ID,客户根据自己业务规则生成,用来针对不同终端用户实现定制化功能。最大长度36个字符。 | |
device | uuid | string | 否 | 客户端全局唯一的ID,需要用户自己生成并传入SDK,最大长度40个字符。一个终端用户可以有多个设备,那么每一个设备的uuid都不同,但user_id相同。 |
parameters.images的参数说明
一级参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
type | string | 是 | 图片类型,支持两种:base64/url |
value | string | 是 | 图片内容。
|
parameters.biz_params的参数说明
一级参数 | 二级参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|---|
commands[i] | name | string | 是 | 表示直通到agent,本实践中固定为“agent_command”,请直接复制使用 |
exec_params | object | 是 | 表示指定的agent,本实践固定,具体请参考commands.exec_params参数说明 |
exec_params | app_id | string | 是 | 表示指定的agent,本实践固定为"visual_qa",请复制使用 |
intent | string | 是 | 表示指定agent的动作,本实践固定为"open_visual_qa",请复制使用 |
请求示例如下
curl请求示例
文本返回事件说明
一级参数 | 二级参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|---|
output | event | string | 是 | 事件名称:RespondingContent |
dialog_id | string | 是 | 对话ID | |
round_id | string | 是 | 本轮交互的ID | |
llm_request_id | string | 是 | 调用llm的request_id | |
text | string | 是 | 系统对外输出的文本,流式增量输出 | |
spoken | string | 是 | 合成语音时使用的文本,流式增量输出 | |
finished | bool | 是 | 输出是否结束 | |
finish_reason | string | 否 | 结束原因,目前只有一种:
| |
extra_info | object | 否 | 其他扩展信息,目前支持:
|
extra_info.agent_info的参数说明
一级参数 | 二级参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|---|
round | string | 是 | 对话轮次 | |
device | device_id | string | 是 | 请求时使用的device.uuid |
intent_infos | intent | string | 是 | 使用的agent,本实践固定为"visual_qa" |
domain | string | 是 | 使用的agent,本实践固定为"visual_qa" |