高速模式为对输出速度敏感的场景提供更高的 TPS。
使用方式
优速模式具备以下关键特性:
- 高速输出:TPS 提升至标准 API 的 1.5~2 倍;适用于 AI 编程助手、Agent 多步推理、实时对话等对输出速度敏感的场景。
- 按 token 计费:计费逻辑与标准 API 一致,按输入与输出 token 计费。
- 特殊限流:调用量达到限流值时,若平台仍有剩余资源,则不会触发限流,因此实际可用 TPS 不低于限流值。
https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1,其中 {workspace_id}可在业务空间管理页面切换到对应地域后查看。
基础调用示例:
glm 5.2 的 prime 模式的模型名称仍然为 glm-5.2-fast-preview。
支持的模型
模型支持的能力、使用限制与原版模型相同
- 华北2(北京)
- 新加坡
文本生成模型 | 模型计费(每百万Token) | ||
|---|---|---|---|
输入单价 | 输出单价 | 缓存命中 | |
qwen3.8-max-prime | 24元 | 72元 | 3元 |
glm-5.2-fast-preview | 16元 | 56元 | 4元 |
视频生成模型 | 模型计费(元/秒) | ||
480P | 720P | 1080P | |
wan3.0-video-prime | 0.45元/秒 | 0.9元/秒 | 1.8元/秒 |
使用示例
模型支持的能力、使用限制与原版模型相同流式调用示例: