本文档介绍如何在阿里云百炼平台调用 智谱 直供的模型推理服务。
服务开通
- 前往百炼控制台,搜索 ZHIPU/GLM,找到智谱GLM系列文本模型卡片,单击立即开通;
- 在弹窗内确认开通及授权。
快速开始
ZHIPU/GLM-5.3 是 GLM 系列最新模型,支持真正可用的 1M 上下文。运行以下代码快速调用思考模式的 ZHIPU/GLM-5.3 模型。
需要已获取与配置 API Key并完成配置API Key到环境变量。如果通过SDK调用,需要安装SDK。
- OpenAI兼容
enable_thinking非 OpenAI 标准参数,OpenAI Python SDK 通过 extra_body传入,Node.js SDK 作为顶层参数传入。- Python
- Node.js
- HTTP
示例代码
返回结果
流式工具调用
ZHIPU/GLM-5.3、ZHIPU/GLM-5.2ZHIPU/GLM-5.1、ZHIPU/GLM-5支持tool_stream参数(boolean,默认false),仅在stream为true时生效。开启后,Function Calling 返回的 tool_call 参数(arguments)会以流式增量方式逐步返回。
stream与tool_stream的组合行为如下:
stream | tool_stream | tool_call 返回方式 |
|---|---|---|
true | true | arguments 以增量方式分多个 chunk 返回 |
true | false(默认) | arguments 在一个 chunk 中完整返回 |
false | true/false | tool_stream 不生效,arguments 在完整响应中一次性返回 |
- OpenAI兼容
- Python
- Node.js
- curl
示例代码
思考控制(thinking.type 与 reasoning_effort)
ZHIPU/GLM-5.3 始终以思考模式运行,不支持关闭思考,请保持 thinking.type 为 enabled(使用 enable_thinking 时保持为 true),并通过 reasoning_effort 控制推理深度。
参数 | 说明 | 支持的值 |
|---|---|---|
| 控制是否开启思考,默认为 |
|
| 控制模型的推理深度。未传入时默认为 |
|
清除历史思考(clear_thinking)
clear_thinking 参数用于控制多轮对话中是否将历史轮次的 reasoning_content(思考过程)作为上下文输入给模型。仅 GLM 系列模型支持。
true:忽略历史轮次的reasoning_content,仅使用可见文本、工具调用与结果等非推理内容作为上下文输入,可降低上下文长度与成本。false(默认):保留历史轮次的reasoning_content并随上下文一同提供给模型。若希望启用 Preserved Thinking,必须在 messages 中完整、未修改、按原顺序透传历史reasoning_content,缺失、裁剪、改写或重排会导致效果下降或无法生效。
assistant 消息中携带 reasoning_content)。设置 clear_thinking=true 后,历史思考内容不会被计入上下文,因此 prompt_tokens 少于 false(默认)的情况,实际数值取决于历史 reasoning_content 的长度。
- OpenAI兼容
其它功能
| 模型 | 多轮对话 | Function Calling | 结构化输出 | 联网搜索 | 前缀续写 | 上下文缓存 | 思考深度控制 |
|---|---|---|---|---|---|---|---|
| ZHIPU/GLM-5.3 | 支持 | 支持 | 不支持 | 不支持 | 支持 | 支持 | 支持reasoning_effort |
| ZHIPU/GLM-5.2 | 支持 | 支持 | 支持仅非思考模式 | 不支持 | 支持 | 支持 | 支持reasoning_effort |
| ZHIPU/GLM-5.1 | 支持 | 支持 | 支持仅非思考模式 | 不支持 | 支持 | 支持 | 不支持 |
| ZHIPU/GLM-5 | 支持 | 支持 | 支持仅非思考模式 | 不支持 | 支持 | 支持 | 不支持 |
- 缓存最少 Token 数为 512(百炼为 1024)。
参数默认值
模型 | enable_thinking | temperature | top_p | top_k | repetition_penalty |
|---|---|---|---|---|---|
ZHIPU/GLM-5.3 | true(不可关闭) | 1.0 | 0.95 | - | - |
ZHIPU/GLM-5.2 | true | 1.0 | 0.95 | - | - |
ZHIPU/GLM-5.1 | true | 1.0 | 0.95 | - | - |
ZHIPU/GLM-5 | true | 1.0 | 0.95 | - | - |
模型列表与计费
GLM 系列模型是智谱AI专为智能体设计的混合推理模型,提供思考与非思考两种模式,其中 ZHIPU/GLM-5.3 仅支持思考模式。
模型上下文长度与价格信息请参见百炼控制台。
按照模型的输入与输出 Token 计费。
思考模式下,思维链按照输出 Token 计费。
错误码
如果执行报错,请参见错误码进行解决。
以下为智谱独有的业务错误码。HTTP 错误码与百炼通用错误码一致,请参见上述链接。
错误分类 | 错误码 | 错误信息 |
|---|---|---|
基础错误 | 500 | 内部错误 |
身份验证错误 | 1000 | 身份验证失败 |
1001 | Header 中未收到 Authentication 参数,无法进行身份验证 | |
1002 | Authentication Token 非法,请确认 Authentication Token 正确传递 | |
1003 | Authentication Token 已过期,请重新生成/获取 | |
1004 | 通过 Authentication Token 的验证失败 | |
1100 | 账户读写 | |
账户错误 | 1110 | 您的账户当前处于非活动状态。请检查账户信息 |
1111 | 您的账户不存在 | |
1112 | 您的账户已被锁定,请联系客服解锁 | |
1113 | 您的账户已欠费,请充值后重试 | |
1120 | 无法成功访问您的账户,请稍后重试 | |
1121 | 账户存违规行为,账号已被锁定 | |
API 调用错误 | 1200 | API 调用错误 |
1210 | API 调用参数有误,请检查文档 | |
1211 | 模型不存在,请检查模型代码 | |
1212 | 当前模型不支持 | |
1213 | 未正常接收到 | |
1214 |
| |
1215 |
| |
1220 | 您无权访问 | |
1221 | API | |
1222 | API | |
1230 | API 调用流程出错 | |
1231 | 您已有请求: | |
1234 | 网络错误,错误id: | |
1261 | Prompt 超长 | |
API 策略阻止错误 | 1300 | API 调用被策略阻止 |
1301 | 系统检测到输入或生成内容可能包含不安全或敏感内容,请您避免输入易产生敏感内容的提示语,感谢您的配合 | |
1302 | 您当前使用该 API 的并发数过高,请降低并发,或联系客服增加限额 | |
1303 | 您当前使用该 API 的频率过高,请降低频率,或联系客服增加限额 | |
1304 | 该 API 已达今日调用次数限额,如有更多需求,请联系客服购买 | |
1305 | 该 API 已触发流量限制 | |
1308 | 已达到 | |
1309 | 您的 GLM Coding Plan 套餐已到期,暂无法使用,前往官方续订后即可恢复 https://bigmodel.cn/claude-code | |
1310 | 您已达到每周/每月使用上限,您的限额将在 | |
1311 | 当前订阅套餐暂未开放 | |
1312 | 该模型当前访问量过大,请您稍后再试,或切换其他模型如 | |
1313 | 您的账户当前使用模式不符合公平使用策略,请求频率已受到限制。详情请参阅《条款与协议-订阅及自动续费协议》,如需恢复请前往个人中心-编程套餐总览-顶部申请解除限制 |