Skip to main content
用量统计与性能监控

模型用量

介绍如何查看阿里云百炼各模型的用量。

如需了解免费额度相关内容,请参考新人免费额度文档。您也可以在免费额度页面查看和管理免费额度使用情况。

适用范围

  • 支持的模型:模型列表中的所有模型均支持查看用量,包括基于它们调优后的模型

查看免费额度使用情况

免费额度页面顶部提供「免费额度使用概览」,按模型总数、额度充沛、使用超 50%、使用超 80%、无免费额度等维度汇总当前空间下各模型的免费额度消耗情况,并展示「免费额度即将用尽TOP3模型」列表,便于快速定位需要关注的模型。 「全部模型」表格列出各模型的模型 Code免费额度剩余量过期时间状态(未开启/已开启/不支持开启)及操作。支持搜索、排序、筛选查找特定模型,点击单条可切换「免费额度用完即停」开关,或查看模型详情抽屉。 页面上方提供批量操作入口,可对所选模型批量开启批量关闭「免费额度用完即停」,也可一键开启/关闭所有模型;操作前会弹出确认提示,操作完成后展示成功与失败结果,完成后可退出批量操作。还可在操作列通过购买节省计划优惠下单购买资源包;若账号未绑定有效支付方式,批量操作将失败并提示绑定银行卡。

在控制台查看免费额度使用情况

  1. 进入免费额度页面,选择模型类型页签查看各模型的免费额度使用情况。
  2. 在全部模型表格中,可通过搜索、排序、筛选等方式查找特定模型,并可切换免费额度用完即停开关或使用批量操作功能管理免费额度设置。
免费额度用完即停: 开启后,免费额度用尽时服务将自动停止(返回403错误:AllocationQuota.FreeTierOnly),避免产生免费额度以外的费用。若您希望在免费额度用尽后仍继续使用模型服务,并根据实际产生的用量付费,请保持本功能关闭状态。您只能在账户内仍有未消耗的免费额度时开启本功能。一旦功能开启,若您需要关闭本功能,需要在免费额度完全消耗后再进行关闭(免费额度消耗记录可在账单中查看,账单记录按分钟汇总生成;控制台免费额度数据分钟级更新,支持手动刷新页面同步,请以控制台显示的免费额度数值为准。)

查看模型用量

模型用量页面查看。数据按业务空间维度统计,不支持按阿里云账号维度统计(如何解决)。数据延迟约为 1 小时
  1. 进入页面后,选择对应的模型类型(如大语言模型)页签,再按需选择时间范围。页面将汇总展示所选时间段内,该推理类型下所有已调用过模型的用量。
    统计时间范围:不支持查看30天以前的统计数据。如需查询更早的用量信息,请通过费用与成本页面查询。
    按推理类型筛选:仅「大语言模型」页签支持按推理类型(实时推理批量推理)筛选;若该空间下从未产生过「批量推理」用量数据,推理类型下拉框只会显示「实时推理」。
    时间精度:支持按分钟小时三种精度查看。时间跨度超过 1 天时分钟精度不可选,超过 7 天时仅支持按天查看。
    按 API-KEY 筛选:可通过 API-KEY 下拉框筛选指定 API Key 调用产生的用量。
  2. 如需查询某个具体模型的用量,可在页面右侧搜索框输入模型名称(如qwen-plus)筛选对应数据。
    可前往模型列表查询模型名称。
  3. 页面底部「总调用成功次数 Top 10 模型」区域汇总展示调用次数最多的 10 个模型,支持全屏查看和下载数据。
「调用模型」表格按模型 Code 列出各模型的调用量、Token 用量等用量指标(指标列随所选模型类型不同而不同)。表格与图表区域的常用操作:
  • 点击单行查看详情,进入模型用量详情页查看该模型更细粒度的调用趋势。
  • 筛选条件较多时可用重置清空,并按需收起/展开筛选区域。
  • 「概览」页签以指标卡片汇总关键用量;「更多指标」页签可切换不同用量维度的趋势图。

查看费用概览

费用概览页面,可查看百炼服务的费用汇总信息,包括:
  • 费用卡片:展示当前账期的总消费金额、订阅购买费用和账单费用,并可跳转查看明细。
  • 账单趋势:以图表或列表形式展示费用趋势,支持按月或按天统计,可按产品分类、API Key ID、模型筛选。
  • 费用告警:可设置费用告警,在费用异常时及时收到通知。

模型用量统计单位说明

在阿里云百炼,不同模型的用量统计口径如下:

类型

二级分类

统计单位

计费说明(模型调用)

大语言模型

按输入和输出对应的 Token 数计费。

视觉模型

按成功生成的 图像张数计费。

视频生成

按成功生成的 视频秒数 计费。

语音模型

秒、字符或 Token

可能按音频时长(秒)、对应的文本字符数或 Token 数计费,视模型而定。

全模态模型

Token

文本部分按 Token 数,其他模态(音频、图像、视频)按对应的 Token 数计费。

向量模型

Token

按输入文本的 Token 数计费。

文本向量模型

应用于生产环境

管理模型用量建议:
  • 控制模型输出长度: 在调用模型 API 时,合理限制思考长度和设置 max_tokens 参数,可限制模型单次生成内容的最大长度(从而控制费用)。
  • 根据任务类型选择模型: 对于分类、摘要等简单任务,优先选择成本更低的轻量级模型,而不是始终使用功能强大但价格也较高的模型。
  • 监控与告警: 通过模型监控监控用量趋势,并可配置用量告警,当用量出现异常时及时收到通知。
  • 优化 Prompt: 简洁、清晰的 Prompt 不仅能提升模型输出质量,也能减少不必要的输入 Token 消耗。
  • 使用批量推理: 对于非实时、大批量的处理任务,使用批量推理通常比实时调用更具成本优势。

名词解释

名词

解释

Token

大模型以 Token 为单位处理输入和输出。一个 Token 可能是:

  • 单个字符:A

  • 完整的单词:largeModel

  • 长单词的一部分:一个长单词通常会被拆分为多个 Token,拆分的过程称为分词。

根据经验,平均1个汉字约对应 1.5-2 个 Token;1 个英文字母约对应 0.25 个 Token;1 个英文单词约对应 1.3 个 Token:

  • 阿里云百炼:约 4-5 个 Token

  • Hello World:约 2 个 Token

每个模型都有最大输入和输出 Token 数(详见模型列表),超过限制会导致请求失败。

实时推理

指对模型的所有直接和间接调用,主要涵盖以下场景:

批量推理

对于无需实时响应的场景,通过OpenAI兼容-Batch(文件输入)接口以离线方式进行的大规模数据处理。

常见问题

Q: 如何查我的阿里云账号的 Token 总用量? A: 使用阿里云账号(主账号)访问账单详情页面并导出账单,然后在账单中查看 Token 用量。 账单详情页面,按以下条件筛选并导出:
  1. 账单月份设置为目标月份(如 2025-05
  2. 产品名称中选择大模型服务平台百炼
  3. 单击表格右上方的下载图标导出账单数据
Q: 可以在阿里云 App 查看免费额度和模型用量吗? A: 暂不支持。阿里云 App 目前不支持查看百炼的免费额度使用情况和模型用量数据。请登录 PC 端,进入百炼控制台的免费额度模型用量页面查看。
Token Plan
模型体验
  • 3D模型生成
  • 音乐生成
模型调优
模型压缩目录节点
用量统计与性能监控
资产中心
服务支持