Skip to main content
开始使用

限流

百炼按主账号维度对模型调用设置限流,账号下所有RAM子账号、业务空间和API Key 的调用量合并计算。超出限制时请求会被拒绝,通常在一分钟内自动恢复。

限流规则

  • 账号级别限流:限流按主账号维度计算,账号下所有RAM子账号、业务空间和API Key 的调用量合并计算。
  • 模型独立限流:不同模型限流额度相互独立,具体参见下方表格。
部分模型,如 qwen3.8-max、qwen3.8-flash 采用 动态限流(新)的方式,根据百炼月消费档位进行软限流。且不支持自助提升临时限流额度。

FAQ

为什么触发限流?

根据错误信息判断触发了哪类限流:
  • Requests rate limit exceededYou exceeded your current requests list:触发了每分钟请求数(RPM)限流。
  • Allocated quota exceededYou exceeded your current quota:触发了每分钟 Token 消耗(TPM)限流。
  • Request rate increased too quickly:请求频率在短时间内激增,触发了系统稳定性保护——即使总调用量未达到 RPM 或 TPM 上限也会触发。
  • 其他报错,参见错误码确认原因。
除 RPM 和 TPM 外,限流策略可能按秒级 RPS(RPM/60)与 TPS(TPM/60)执行。即使每分钟总调用量未超限,短时间内的请求爆发也可能触发限流。

如何查看模型调用量?

模型调用完一小时后,在模型监控(北京新加坡)页面设置查询条件(例如,选择时间范围、业务空间等),再在模型列表区域找到目标模型并单击操作列的监控,即可查看该模型的调用统计结果。具体请参见模型监控文档。
数据按小时更新,高峰期可能有小时级延迟,请您耐心等待。
image

遇到限流后多久恢复?

通常在一分钟内恢复。如出现其他报错,参见错误码进行处理。

模型响应速度与付费有关吗?

模型输出速度与是否付费无关。免费额度和付费调用使用相同的模型服务基础设施,同一模型的生成速度相同。免费额度仅控制请求是否被接受——额度耗尽时返回 403 错误(开通免费额度用完即停后),不会降低已接受请求的生成速度。

什么因素影响模型响应速度?

  • 模型类型:轻量模型(如 qwen-flash)比大型模型(如 qwen-max)生成更快。
  • 输出长度:输出 Token 越多,总耗时越长。
  • 服务器负载:高峰期可能略有波动。

限流会降低已接受请求的生成速度吗?

不会。限流(RPM/TPM)仅导致超出限制的请求被拒绝(返回 429 错误)。免费额度耗尽时(开通免费额度用完即停)返回 403 错误,同样不影响已接受请求的速度。429 为速率限制,403 为配额耗尽,两者均为拒绝机制。

如何避免限流?

  1. 选用高限流模型
    • 优先使用 qwen-plus 等限流额度更高的模型。
    • 稳定版或最新版比带日期的快照版本限流更宽松。
  2. 优化调用策略
    • 降低调用频率:收到 Requests rate limit exceededYou exceeded your current requests list 时,降低API调用频率。
    • 减少 Token 消耗:收到 Allocated quota exceededYou exceeded your current quota 时,缩短输入或限制输出长度。
    • 平滑请求速率:收到 Request rate increased too quickly 时,采用匀速调度、指数退避或请求队列将请求均匀分散,避免瞬时高峰。
  3. 添加备选模型 触发限流后切换到备用模型继续生成,可降低失败概率、提升吞吐量。以下代码在调用 qwen-plus-2025-07-28 触发限流后,自动改用 qwen-plus-2025-07-14 重试。也可以选择不同系列的模型(如 qwen-flash)作为备选模型,进一步降低主备模型同时限流的风险。
    import os
    import asyncio
    from openai import AsyncOpenAI, APIStatusError
    
    # 配置
    API_KEY = os.getenv("DASHSCOPE_API_KEY")
    # 主用模型
    MODEL = "qwen-plus-2025-07-28"
    # 备选模型
    BACKUP_MODEL = "qwen-plus-2025-07-14"
    # 测试问题
    QUESTION = "你是谁?"
    # 并发设置
    NUM_REQUESTS = 10
    
    client = AsyncOpenAI(
        api_key=API_KEY,
        # 以下为华北2(北京)地域的URL,请将WorkspaceId替换为真实的业务空间ID。
        base_url="https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1"
    )
    
    async def send_request(model):
        """发送单个请求"""
        try:
            await client.chat.completions.create(
                model=model,
                messages=[{"role": "user", "content": QUESTION}]
            )
            return True
        except APIStatusError as e:
            if e.status_code == 429:
                print(f"[限流触发] 模型 {model}")
                return False
            raise
        except Exception as e:
            print(f"[请求失败] 模型 {model},错误:{e}")
            return False
    
    async def task(i):
        # 尝试主模型
        if await send_request(MODEL):
            return True
        # 限流时尝试备用模型
        return await send_request(BACKUP_MODEL)
    
    async def main():
        results = await asyncio.gather(*(task(i) for i in range(NUM_REQUESTS)))
        print(f"成功请求: {sum(results)}, 失败请求: {len(results) - sum(results)}")
    
    if __name__ == "__main__":
        asyncio.run(main())
    
  4. 拆分任务:长对话或大型文档会快速消耗大量 Token。将大批量任务拆分为小批次,分时段提交。
  5. 批量推理:无需实时响应时,使用批量推理(Batch API)。批量请求不受实时限流约束,但需考虑排队和处理时间。
  6. 提升限流额度:默认限流额度不足时,在百炼控制台的限流提额页面提升模型的临时 TPM 额度,提交后立即生效。详见提升临时限流额度

如何控制 Token 用量或费用支出?

限流仅约束单位时间内的调用速率,不限制累计用量。如需控制 Token 用量或费用支出,可通过以下方式管理:
  • 设置消费限额与费用告警:在账单费用卡片设置费用告警,开启月度消费限额并配置阈值通知,达到阈值即提醒,避免超额支出。详见账单查询与成本管理
  • 开启免费额度用完即停:对支持免费额度的模型,可开启免费额度用完即停,免费额度耗尽后自动停止调用,避免产生额外费用。详见新人免费额度
  • 监控模型调用量:定期查看各模型的 Token 用量,及时发现异常增长,参见上文如何查看模型调用量?

充值后是否还会被限流?

充值不改变模型默认的 RPM 和 TPM 限流阈值。限流按阿里云主账号维度配置,与计费相互独立;充值(按量付费)仅确保账号不因欠费停服,不会提升限流值。 如需更高的限流额度,请参见本文如何避免限流?,或在百炼控制台的限流提额页面申请提升临时限流额度

提升临时限流额度

默认限流额度不足时,可在百炼控制台提升模型的临时 TPM 额度。提交后立即生效,有效期 30 天,到期后自动恢复为系统默认值。 目前支持华北2(北京)和新加坡地域。
  1. 登录百炼控制台,进入限流提额页面。
  2. 单击页面右上角的提升模型临时限流额度
  3. 在弹窗中选择模型,填写期望的 Token 账号限流(Token/60 秒)值。弹窗中会显示当前额度和可设置上限。
  4. 单击确定,提额立即生效。
提额生效后,可通过以下方式确认:
  • 限流提额页面的列表中,查看已提额的模型及对应限流数据。
  • 模型广场中进入对应模型的详情页,查看更新后的限流数据。
  • 支持临时提额的模型以限流提额页面弹窗的可选列表为准。
  • 对已提额的模型再次提交视为重新申请,有效期随之重置为 30 天。
  • 按实际需求申请额度。若配置容量长期显著超过实际使用量,系统可能在提前通知后将其恢复为默认值。
  • 若限流额度不满足需求,请联系商务经理申请提额。

文本生成-千问

千问语言模型

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
  • 日本(东京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.8-max
Batch API调用服务时,不受限流限制。
30,0005,000,000
qwen3.8-flash
Batch API调用服务时,不受限流限制。
30,0005,000,000
qwen3.7-max
Batch API调用服务时,不受限流限制。
30,0005,000,000
qwen3.7-max-2026-06-086001,000,000
qwen3.7-max-2026-05-206001,000,000
qwen3.7-max-preview60500,000
qwen3.7-max-2026-05-1760500,000
qwen3.6-max-preview6001,000,000
qwen3-max
Batch API调用服务时,不受限流限制。
30,0005,000,000
qwen3-max-2026-01-236001,000,000
qwen3-max-2025-09-2360100,000
qwen3-max-preview6001,000,000
qwen-max
Batch API调用服务时,不受限流限制。
1,2001,000,000
qwen3.7-plus30,0005,000,000
qwen3.7-plus-2026-05-266001,000,000
qwen3.6-plus
Batch API调用服务时,不受限流限制。
30,0005,000,000
qwen3.6-plus-2026-04-026001,000,000
qwen3.7-flash
Batch API调用服务时,不受限流限制。
30,0005,000,000
qwen3.7-flash-2026-07-1530,0005,000,000
qwen3.6-flash
Batch API调用服务时,不受限流限制。
30,00010,000,000
qwen3.6-flash-2026-04-166001,000,000
qwen3.5-plus
Batch API调用服务时,不受限流限制。
30,0005,000,000
qwen3.5-plus-2026-04-206001,000,000
qwen3.5-plus-2026-02-156001,000,000
qwen-plus
Batch API调用服务时,不受限流限制。
30,0005,000,000
qwen-plus-latest
Batch API调用服务时,不受限流限制。
15,0001,200,000
qwen-plus-2025-12-011201,000,000
qwen-plus-2025-09-11601,000,000
qwen-plus-2025-07-28(qwen-plus-0728)601,000,000
qwen-plus-2025-07-14(qwen-plus-0714)60100,000
qwen-plus-2025-04-28(qwen-plus-0428)601,000,000
qwen-plus-2025-01-25(qwen-plus-0125)60150,000
qwen-plus-2025-01-12(qwen-plus-0112)60150,000
qwen-plus-2024-12-20(qwen-plus-1220)60150,000
qwen3.5-flash
Batch API调用服务时,不受限流限制。
30,00010,000,000
qwen3.5-flash-2026-02-236001,000,000
qwen-flash
Batch API调用服务时,不受限流限制。
30,00010,000,000
qwen-flash-2025-07-28601,000,000
qwen-turbo
Batch API调用服务时,不受限流限制。
1,2005,000,000
qwq-plus
Batch API调用服务时,不受限流限制。
6001,000,000
qwen-long
Batch API调用服务时,不受限流限制。
1,2003,000,000
qwen-long-latest
Batch API调用服务时,不受限流限制。
1,20060,000
qwen-long-2025-01-25(qwen-long-0125)37,500

千问VL(视觉理解/图生文)

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-vl-plus
Batch API调用服务时,不受限流限制。
3,0005,000,000
qwen3-vl-plus-2025-12-1960100,000
qwen3-vl-plus-2025-09-2360100,000
qwen3-vl-flash
Batch API调用服务时,不受限流限制。
3,0005,000,000
qwen3-vl-flash-2026-01-2260100,000
qwen3-vl-flash-2025-10-1560100,000
qwen-vl-max
Batch API调用服务时,不受限流限制。
1,2001,000,000
qwen-vl-plus
Batch API调用服务时,不受限流限制。
1,2001,000,000
qvq-max60100,000
qvq-plus60100,000

千问Omni

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.5-omni-plus60100,000
qwen3.5-omni-plus-2026-03-1560100,000
qwen3.5-omni-flash60100,000
qwen3.5-omni-flash-2026-03-1560100,000
qwen3-omni-flash60100,000
qwen3-omni-flash-2025-12-0160100,000
qwen3-omni-flash-2025-09-1560100,000
qwen-omni-turbo
Batch API调用服务时,不受限流限制。
60100,000
qwen-omni-turbo-latest60100,000
qwen-omni-turbo-2025-03-26(qwen-omni-turbo-0326)60100,000
qwen-omni-turbo-2025-01-19(qwen-omni-turbo-0119)60100,000

千问Omni-Realtime

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.5-omni-plus-realtime60100,000
qwen3.5-omni-plus-realtime-2026-03-1560100,000
qwen3.5-omni-flash-realtime60100,000
qwen3.5-omni-flash-realtime-2026-03-1560100,000
qwen3-omni-flash-realtime60100,000
qwen3-omni-flash-realtime-2025-12-0160100,000
qwen3-omni-flash-realtime-2025-09-1560100,000
qwen-omni-turbo-realtime-latest60100,000
qwen-omni-turbo-realtime-2025-05-0860100,000

千问OCR(文字提取)

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.5-ocr6,00030,000,000
qwen-vl-ocr
Batch API调用服务时,不受限流限制。
6006,000,000
qwen-vl-ocr-latest
Batch API调用服务时,不受限流限制。
6,00030,000,000
qwen-vl-ocr-2025-11-206,00030,000,000
qwen-vl-ocr-2025-08-286006,000,000
qwen-vl-ocr-2025-04-136006,000,000
qwen-vl-ocr-2024-10-286006,000,000

千问Audio(音频理解)

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-audio-turbo120100,000
qwen-audio-turbo-latest60无 TPM 限制

千问数学模型

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-math-plus1,2001,000,000
qwen-math-plus-latest1,2001,000,000
qwen-math-plus-2024-09-19(qwen-math-plus-0919)60100,000
qwen-math-plus-2024-08-16(qwen-math-plus-0816)1020,000
qwen-math-turbo12001,000,000

千问Coder

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-coder-plus5,0005,000,000
qwen3-coder-plus-2025-09-23601,000,000
qwen3-coder-plus-2025-07-22601,000,000
qwen3-coder-flash5,0005,000,000
qwen3-coder-flash-2025-07-28601,000,000
qwen-coder-plus1,2001,000,000
qwen-coder-turbo1,2001,000,000

千问翻译模型

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-mt-plus6025,000
qwen-mt-flash6035,000
qwen-mt-lite60100,000
qwen-mt-turbo6035,000

千问数据挖掘模型

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-doc-turbo6003,000,000

千问深入研究模型

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-deep-research1201,200,000

通义晓蜜对话分析模型

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
tongyi-xiaomi-analysis-flash6001,000,000
tongyi-xiaomi-analysis-pro6001,000,000

文本生成-千问-开源版

千问语言模型开源版

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.8-2.4t-a95b5,0005,000,000
qwen3.8-27b5,0005,000,000
qwen3.6-35b-a3b6001,000,000
qwen3.6-27b6001,000,000
qwen3.5-397b-a17b6001,000,000
qwen3.5-122b-a10b6001,000,000
qwen3.5-27b6001,000,000
qwen3.5-35b-a3b6001,000,000
qwen3-next-80b-a3b-thinking6001,000,000
qwen3-next-80b-a3b-instruct6001,000,000
qwen3-235b-a22b-thinking-25076001,000,000
qwen3-235b-a22b-instruct-25076001,000,000
qwen3-30b-a3b-thinking-25076001,000,000
qwen3-30b-a3b-instruct-25076001,000,000
qwen3-235b-a22b6001,000,000
qwen3-30b-a3b6001,000,000
qwen3-32b24001,000,000
qwen3-14b6001,000,000
qwen3-8b6001,000,000

Qwen-VL

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-vl-32b-thinking6001,000,000
qwen3-vl-32b-instruct6001,000,000
qwen3-vl-30b-a3b-thinking6001,000,000
qwen3-vl-30b-a3b-instruct6001,000,000
qwen3-vl-8b-thinking6001,000,000
qwen3-vl-8b-instruct6001,000,000
qwen3-vl-235b-a22b-thinking60100,000
qwen3-vl-235b-a22b-instruct60100,000

Qwen-Omni

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen2.5-omni-7b60100,000

Qwen3-Omni-Captioner

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-omni-30b-a3b-captioner60100,000

Qwen-Coder

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-coder-next6001,000,000
qwen3-coder-480b-a35b-instruct6001,000,000
qwen3-coder-30b-a3b-instruct6001,000,000

文本生成-第三方模型

DeepSeek

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
  • 日本(东京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
deepseek-v4-pro15,0001,200,000
deepseek-v4-pro-081315,0001,200,000
deepseek-v4-flash-073115,0001,200,000
deepseek-v4-flash15,0001,200,000
deepseek-v3.2
Batch API调用服务时,不受限流限制。
15,0001,000,000
deepseek-v3.2-exp15,0001,200,000
deepseek-v3.115,0001,200,000
deepseek-r1-052860100,000
deepseek-r1
Batch API调用服务时,不受限流限制。
15,0001,200,000
deepseek-v3
Batch API调用服务时,不受限流限制。
15,0001,200,000
deepseek-r1-distill-qwen-7b15,0001,200,000
deepseek-r1-distill-qwen-14b15,0001,200,000
deepseek-r1-distill-qwen-32b15,0001,200,000
deepseek-r1-distill-qwen-1.5b60100,000
deepseek-r1-distill-llama-8b60100,000
deepseek-r1-distill-llama-70b60100,000

DeepSeek-硅基流动直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
siliconflow/deepseek-v3.2500500,000
siliconflow/deepseek-v3.1-terminus500500,000
siliconflow/deepseek-r1-0528500500,000
siliconflow/deepseek-v3-0324500500,000

DeepSeek-快手万擎直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
vanchin/deepseek-v3.2-think30600,000
vanchin/deepseek-v3.1-terminus5001,000,000
vanchin/deepseek-r15001,000,000
vanchin/deepseek-v35001,000,000
vanchin/deepseek-ocr5001,000,000
vanchin/deepseek-v4-pro60300,000
vanchin/deepseek-v4-pro-081330600,000

Kimi

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 德国(法兰克福)
  • 日本(东京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
kimi-k315,0001,200,000
kimi-k2.7-code5001,000,000
kimi-k2.65001,000,000
kimi-k2.55001,000,000
kimi-k2-thinking5001,000,000
Moonshot-Kimi-K2-Instruct5001,000,000

Kimi-月之暗面直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
kimi/kimi-k3500
同一个阿里云百炼API Key 下,在 5 个模型中共享 500 RPM 限流配额。即这 5 个模型的每分钟请求总数加起来不能超过 500。
3,000,000
同一个阿里云百炼API Key 下,在 5 个模型中共享 3000000 TPM 限流配额。即这 5 个模型的每分钟 Token 消耗总数加起来不能超过 3000000。
kimi/kimi-k2.7-code-highspeed
kimi/kimi-k2.7-code
kimi/kimi-k2.6
kimi/kimi-k2.5

GLM

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 德国(法兰克福)
  • 日本(东京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
glm-5.25002,000,000
glm-5.15001,000,000
glm-55001,000,000
glm-4.75001,000,000
glm-4.6601,000,000
glm-4.5601,000,000
glm-4.5-air601,000,000

GLM-智谱直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
ZHIPU/GLM-5.32003,000,000
ZHIPU/GLM-5.22003,000,000
ZHIPU/GLM-5.12003,000,000
ZHIPU/GLM-52003,000,000

MiniMax

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
MiniMax-M2.55001,000,000
MiniMax-M2.15001,000,000

MiniMax-稀宇科技直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
MiniMax/MiniMax-M350020,000,000
MiniMax/MiniMax-M2.750020,000,000
MiniMax/MiniMax-M2.550020,000,000
MiniMax/MiniMax-M2.150020,000,000

MiMo-小米直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
xiaomi/mimo-v2.5-pro10010,000,000

Stepfun-阶跃星辰直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
stepfun/step-3.7-flash50020,000,000

Unisound-云知声直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
unisound/unisound-u23003,000,000

图像生成

千问(Qwen-Image)

  • 华北2(北京)
  • 新加坡
  • 德国(法兰克福)
  • 日本(东京)

模型名称

限流条件(超出任一数值时触发限流)

任务下发接口调用限制

同时处理中任务数量(并发数)

qwen-image-3.0-pro

5 次/分钟

同步接口无限制 / 异步接口 10

qwen-image-3.0

20 次/分钟

同步接口无限制 / 异步接口 10

qwen-image-2.0-pro

2 次/分钟

同步接口无限制

qwen-image-2.0-pro-2026-06-22

2 次/分钟

同步接口无限制

qwen-image-2.0-pro-2026-04-22

2 次/分钟

同步接口无限制

qwen-image-2.0-pro-2026-03-03

2 次/分钟

同步接口无限制

qwen-image-2.0

2 次/秒

同步接口无限制

qwen-image-2.0-2026-03-03

2 次/秒

同步接口无限制

qwen-image-max

2 次/分钟

同步接口无限制

qwen-image-max-2025-12-30

2 次/分钟

同步接口无限制

qwen-image-plus

2 次/秒

同步接口无限制 / 异步接口 2

qwen-image-plus-2026-01-09

2 次/秒

同步接口无限制

qwen-image

2 次/秒

同步接口无限制 / 异步接口 2

qwen-image-edit-max

2 次/分钟

同步接口无限制

qwen-image-edit-max-2026-01-16

2 次/分钟

同步接口无限制

qwen-image-edit-plus

2 次/秒

同步接口无限制

qwen-image-edit-plus-2025-12-15

2 次/秒

同步接口无限制

qwen-image-edit-plus-2025-10-30

2 次/秒

同步接口无限制

qwen-image-edit

2 次/秒

同步接口无限制

qwen-mt-image-2.0

60 次/分钟

2

qwen-mt-image

1 次/秒

2

文生图-Z-Image

  • 华北2(北京)
  • 新加坡

模型名称

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

z-image-turbo

2

同步接口无限制

万相

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)

模型名称

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

wan2.7-image-pro

5

5

wan2.7-image

5

5

wan2.6-image

5

5

wan2.6-t2i

1

5

wan2.5-t2i-preview

5

5

wan2.2-t2i-plus

2

2

wan2.2-t2i-flash

2

2

wanx2.1-t2i-plus

2

2

wanx2.1-t2i-turbo

2

2

wanx2.0-t2i-turbo

2

2

wan2.5-i2i-preview

5

5

wanx2.1-imageedit

2

2

wanx-v1

2

1

wanx-x-painting

2

1

wanx-sketch-to-image-lite

2

1

图像编辑与生成

  • 华北2(北京)

模型名称

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

shoemodel-v1

2

1

wanx-virtualmodel

2

1

wanx-style-repaint-v1

2

2

wanx-poster-generation-v1

2

1

virtualmodel-v2

2

1

wanx-background-generation-v2

2

1

image-instance-segmentation

2

1

image-erase-completion

2

1

image-out-painting

2

10

人物写真生成-FaceChain

  • 华北2(北京)

模型名称

限流条件(超出任一数值时触发限流)

作业提交接口RPS限制

同时处理中任务数量

facechain-facedetect

5

同步接口无限制

facechain-finetune

1

1

facechain-generation

2

1

创意文字生成-WordArt锦书

  • 华北2(北京)

模型名称

限流条件(超出任一数值时触发限流)

作业提交接口RPS限制

同时处理中任务数量

wordart-texture

2

1

wordart-semantic

2

1

AI试衣-OutfitAnyone

  • 华北2(北京)

模型名称

限流条件(超出任一数值时触发限流)

作业提交接口RPS限制

同时处理中任务数量

aitryon

10

5

aitryon-plus

10

5

aitryon-parsing-v1

10

同步接口无限制

aitryon-refiner

10

5

图像生成-第三方模型

可灵系列

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
每秒钟任务下发接口RPS限制同时处理中任务数量(并发数)
kling/kling-v3-omni-image-generation510
同一阿里云百炼API Key 下,可灵系列的 5 个模型(图像视频)共享 10 个并发数。即这 5 个模型处于运行状态的任务总数加起来不能超过 10 个。
kling/kling-v3-image-generation

Vidu系列

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
每分钟请求数RPM限制同时处理中任务数量(并发数)
vidu/vidu-image-pro_reference2image3005
同一个阿里云百炼API Key 下,Vidu参考生图系列的模型共享 5 个并发数。即所有模型处于运行状态的任务总数加起来不能超过 5 个。
vidu/vidu-image-lite_reference2image
vidu/vidu-image_reference2image
vidu/viduq3-fast_reference2image
vidu/viduq2-pro_reference2image
vidu/viduq2-fast_reference2image

音乐生成

  • 华北2(北京)

模型名称

每分钟调用次数(RPM)

fun-music-preview

180

fun-music-v1

180

语音对话

实时语音对话

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-audio-3.0-realtime-plus60100,000
qwen-audio-3.0-realtime-flash60100,000

语音合成(文本转语音)

Qwen-Audio-TTS

  • 华北2(北京)
  • 新加坡

模型名称

提交作业接口RPS限制

qwen-audio-3.0-tts-plus

3

qwen-audio-3.0-tts-flash

3

Qwen-TTS

  • 华北2(北京)
  • 新加坡
  • Qwen3-TTS-Instruct-Flash
  • Qwen3-TTS-VD
  • Qwen3-TTS-VC
  • Qwen3-TTS-Flash
  • Qwen-TTS

模型名称

每分钟调用次数(RPM)

qwen3-tts-instruct-flash

180

qwen3-tts-instruct-flash-2026-01-26

180

Qwen-TTS-Realtime

  • 华北2(北京)
  • 新加坡
  • Qwen3-TTS-Instruct-Flash-Realtime
  • Qwen3-TTS-VD-Realtime
  • Qwen3-TTS-VC-Realtime
  • Qwen3-TTS-Flash-Realtime
  • Qwen-TTS-Realtime

模型名称

每分钟调用次数(RPM)

qwen3-tts-instruct-flash-realtime

180

qwen3-tts-instruct-flash-realtime-2026-01-22

180

Qwen-TTS声音复刻

  • 华北2(北京)
  • 新加坡

模型名称

每分钟调用次数(RPM)

qwen-voice-enrollment

180

Qwen-TTS声音设计

  • 华北2(北京)
  • 新加坡

模型名称

每分钟调用次数(RPM)

qwen-voice-design

180

CosyVoice

  • 华北2(北京)
  • 新加坡

模型名称

提交作业接口RPS限制

cosyvoice-v3.5-plus

3

cosyvoice-v3.5-flash

cosyvoice-v3-plus

cosyvoice-v3-flash

cosyvoice-v2

cosyvoice-v1

Qwen-Audio-TTS/CosyVoice声音复刻/设计

Qwen-Audio-TTS/CosyVoice声音复刻/设计共用一个模型,共用限流额度。
  • 华北2(北京)
  • 新加坡

模型名称

提交作业接口RPS限制

voice-enrollment

10

Sambert

  • 华北2(北京)

模型服务

提交作业接口RPS限制

Sambert系列模型

20

语音合成(文本转语音)-第三方模型

MiniMax-稀宇科技直供

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
每分钟调用次数(RPM)每分钟消耗字符数
仅含输入字符数
MiniMax/speech-2.8-hd2020,000
MiniMax/speech-02-hd2020,000
MiniMax/speech-2.8-turbo2020,000
MiniMax/speech-02-turbo2020,000

语音识别(语音转文本)与翻译(语音转成指定语种的文本)

Qwen3-LiveTranslate-Flash

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-livetranslate-flash100100,000
qwen3-livetranslate-flash-2025-12-01

Qwen-LiveTranslate-Flash-Realtime

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3.5-livetranslate-flash-realtime10100,000
qwen3.5-livetranslate-flash-realtime-2026-05-19
qwen3-livetranslate-flash-realtime
qwen3-livetranslate-flash-realtime-2025-09-22

Qwen-Audio-3.0-ASR-Flash-Streaming

  • 华北2(北京)
  • 新加坡

模型名称

提交作业接口RPS限制

qwen-audio-3.0-asr-flash-streaming

20

Qwen-Audio-3.0-ASR-Flash-Filetrans

  • 华北2(北京)
  • 新加坡

模型名称

每分钟调用次数(RPM)

qwen-audio-3.0-asr-flash-filetrans

600

Qwen-Audio-3.0-ASR-Flash

  • 华北2(北京)
  • 新加坡

模型名称

每分钟调用次数(RPM)

qwen-audio-3.0-asr-flash

600

Qwen-ASR

  • 华北2(北京)
  • 新加坡
  • 美国(弗吉尼亚)
  • Qwen3-ASR-Flash-Filetrans
  • Qwen3-ASR-Flash

模型名称

每分钟调用次数(RPM)

qwen3-asr-flash-filetrans

100

qwen3-asr-flash-filetrans-2025-11-17

Qwen-ASR-Realtime

  • 华北2(北京)
  • 新加坡

模型名称

每秒钟调用次数(RPS)

qwen3-asr-flash-realtime

20

qwen3-asr-flash-realtime-2026-02-10

qwen3-asr-flash-realtime-2025-10-27

Fun-ASR

  • 华北2(北京)
  • 新加坡

模型名称

每分钟调用次数(RPM)

fun-asr

600

fun-asr-2025-11-07

fun-asr-2025-08-25

fun-asr-mtl

fun-asr-mtl-2025-08-25

fun-asr-flash-2026-06-15

Fun-ASR-Realtime

  • 华北2(北京)
  • 新加坡

模型名称

提交作业接口RPS限制

fun-asr-realtime

20

fun-asr-realtime-2026-02-28

fun-asr-realtime-2025-11-07

fun-asr-realtime-2025-09-15

fun-asr-flash-8k-realtime

fun-asr-flash-8k-realtime-2026-01-28

Paraformer

  • 华北2(北京)

模型名称

提交作业接口RPS限制

paraformer-realtime-v2

20

paraformer-realtime-v1

paraformer-realtime-8k-v2

paraformer-realtime-8k-v1

模型名称

每分钟调用次数(RPM)

paraformer-v2

1,200

模型名称每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
paraformer-v16006,000,000
paraformer-mtl-v16006,000,000

模型名称

提交作业接口RPS限制

同时处理中任务数量(并发数)

paraformer-8k-v2

20

100

paraformer-8k-v1

10

500

视频生成

HappyHorse系列

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
  • 日本(东京)

模型名称

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

happyhorse-1.1-t2v

5

5

happyhorse-1.1-i2v

5

5

happyhorse-1.1-r2v

5

5

happyhorse-1.0-t2v

5

5

happyhorse-1.0-i2v

5

5

happyhorse-1.0-r2v

5

5

happyhorse-1.0-video-edit

5

5

万相系列

  • 华北2(北京)
  • 美国(弗吉尼亚)
  • 新加坡
  • 德国(法兰克福)
  • 日本(东京)

模型名称

限流条件(超出任一数值时触发限流)

每秒钟任务下发接口RPS限制

同时处理中任务数量(并发数)

wan3.0-video-prime

5

5

wan3.0-video

5

5

wan2.7-r2v-2026-06-12

5

5

wan2.7-t2v-2026-06-12

5

5

wan2.7-t2v-2026-04-25

5

5

wan2.7-t2v

5

5

wan2.6-t2v

5

5

wan2.5-t2v-preview

5

5

wan2.2-t2v-plus

2

2

wanx2.1-t2v-turbo

2

2

wanx2.1-t2v-plus

2

2

wan2.7-i2v-2026-04-25

5

5

wan2.7-i2v

5

5

wan2.6-i2v-flash

5

5

wan2.6-i2v

5

5

wan2.5-i2v-preview

5

5

wan2.2-i2v-flash

2

2

wan2.2-i2v-plus

2

2

wanx2.1-i2v-turbo

2

2

wanx2.1-i2v-plus

2

2

wan2.2-kf2v-flash

2

2

wanx2.1-kf2v-plus

2

2

wanx2.1-vace-plus

2

2

wan2.7-videoedit

5

5

wan2.7-r2v

5

5

wan2.6-r2v-flash

5

5

wan2.6-r2v

5

5

wan2.2-s2v-detect

5

同步接口无限制

wan2.2-s2v

5

1

wan2.2-animate-move

5

1

wan2.2-animate-mix

5

1

舞动人像AnimateAnyone

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

animate-anyone-detect-gen2

5

同步接口无限制

animate-anyone-template-gen2

5

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

animate-anyone-gen2

5

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

animate-anyone-detect

5

1算力单元支持2并发

animate-anyone

5

1算力单元支持1并发

悦动人像EMO

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

emo-detect-v1

5

同步接口无限制

emo-v1

5

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

灵动人像LivePortrait

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

liveportrait-detect

5

同步接口无限制

liveportrait

5

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

声动人像VideoRetalk

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

videoretalk

1

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

表情包Emoji

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

emoji-detect-v1

1

同步接口无限制

emoji-v1

1

1

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

视频风格重绘

  • 华北2(北京)

模型名称

任务下发接口RPS限制

同时处理中任务数量

video-style-transform

20

2

在同一时刻,只有1个作业实际处于运行状态,其他队列中的作业处于排队状态。

视频生成-第三方模型

爱诗系列

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
每分钟任务下发接口RPM限制同时处理中任务数量(并发数)
pixverse/pixverse-lipsync3005
同一个阿里云百炼API Key 在 3 个模型间共享额度。即这 3 个模型处于运行状态的任务总数加起来不能超过 5 个。
pixverse/pixverse-motioncontrol300
pixverse/pixverse-upscale300
模型名称限流条件(超出任一数值时触发限流)
每秒钟任务下发接口RPS限制同时处理中任务数量(并发数)
pixverse/pixverse-c1-t2v55
同一个阿里云百炼API Key 在 4个模型间共享额度。即这 4个模型处于运行状态的任务总数加起来不能超过 5 个。
pixverse/pixverse-c1-it2v
pixverse/pixverse-c1-kf2v
pixverse/pixverse-c1-r2v
pixverse/pixverse-v6-r2v-omni55
同一个阿里云百炼API Key 在 5 个模型间共享额度。即这 5 个模型处于运行状态的任务总数加起来不能超过 5 个。
pixverse/pixverse-v6-t2v
pixverse/pixverse-v6-it2v
pixverse/pixverse-v6-kf2v
pixverse/pixverse-v6-r2v
pixverse/pixverse-v5.6-t2v55
同一个阿里云百炼API Key 在 4 个模型间共享额度。即这 4 个模型处于运行状态的任务总数加起来不能超过 5 个。
pixverse/pixverse-v5.6-it2v
pixverse/pixverse-v5.6-kf2v
pixverse/pixverse-v5.6-r2v

可灵系列

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
每秒钟任务下发接口RPS限制同时处理中任务数量(并发数)
kling/kling-v3-omni-video-generation510
同一阿里云百炼API Key 下,可灵系列的 5 个模型(图像视频)共享 10 个并发数。即这 5 个模型处于运行状态的任务总数加起来不能超过 10 个。
kling/kling-v3-turbo-video-generation
kling/kling-v3-video-generation

Vidu系列

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
每秒钟任务下发接口RPS限制同时处理中任务数量(并发数)
vidu/viduq3-ad_reference2video55
同一个阿里云百炼API Key 在 20 个模型间共享并发额度。即这 20 个模型处于运行状态的任务总数加起来不能超过 5 个。
vidu/viduq3-drama_reference2video5
vidu/viduq3-pro-fast_img2video5
vidu/viduq3-turbo_text2video5
vidu/viduq3-pro_text2video5
vidu/viduq2_text2video5
vidu/viduq3-turbo_img2video5
vidu/viduq3-pro_img2video5
vidu/viduq2-turbo_img2video5
vidu/viduq2-pro_img2video5
vidu/viduq2-pro-fast_img2video5
vidu/viduq3-turbo_start-end2video5
vidu/viduq3-pro_start-end2video5
vidu/viduq2-turbo_start-end2video5
vidu/viduq2-pro_start-end2video5
vidu/viduq3-mix_reference2video5
vidu/viduq3_reference2video5
vidu/viduq3-turbo_reference2video5
vidu/viduq2-pro_reference2video5
vidu/viduq2_reference2video5

MiniMax系列

  • 华北2(北京)

模型名称

限流条件(超出任一数值时触发限流)

每分钟任务下发接口RPM限制

同时处理中任务数量(并发数)

MiniMax/MiniMax-H3

300

5

3D模型生成-第三方模型

Tripo系列

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
每分钟任务下发接口RPM限制同时处理中任务数量(并发数)
Tripo/Tripo-H3.1510
同一个阿里云百炼API Key 在 2 个模型间共享额度。即这 2 个模型处于运行状态的任务总数加起来不能超过 10 个。
Tripo/Tripo-P1.05

向量模型

文本向量

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
每分钟调用次数(RPM)每分钟消耗Token数(TPM)/作业数
仅输入Token
qwen3.7-text-embedding24,0001,000,000
qwen3.7-text-embedding-flash24,0001,000,000
text-embedding-v1
Batch API调用服务时,不受限流限制。
1,8001,200,000
text-embedding-v2
Batch API调用服务时,不受限流限制。
1,8001,200,000
text-embedding-v3
Batch API调用服务时,不受限流限制。
1,8001,200,000
text-embedding-v4
Batch API调用服务时,不受限流限制。
1,8001,200,000
text-embedding-async-v160当前用户在系统通用文本向量异步作业排队中和运行中的作业数量不超过50个。另外,为了避免大量突发的作业占据太多资源,限制并发的作业数为3个,即任意时间,单个用户最多只有3个通用文本向量的异步作业在并发运行,其他的作业只能在队列中等待。
text-embedding-async-v260当前用户在系统通用文本向量异步作业排队中和运行中的作业数量不超过50个。另外,为了避免大量突发的作业占据太多资源,限制并发的作业数为3个,即任意时间,单个用户最多只有3个通用文本向量的异步作业在并发运行,其他的作业只能在队列中等待。

多模态向量

  • 华北2(北京)
模型名称限流条件
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
仅输入Token
qwen3-vl-embedding2,4001,200,000
qwen2.5-vl-embedding1,200600,000
tongyi-embedding-vision-plus600200,000
tongyi-embedding-vision-flash600200,000
tongyi-embedding-vision-flash-2026-03-061,2009,600,000
tongyi-embedding-vision-plus-2026-03-061,2009,600,000
multimodal-embedding-v11201,000,000

排序模型

排序模型

  • 华北2(北京)
  • 新加坡
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen3-rerank5,4005,000,000,000
qwen3-vl-rerank6009,000,000
gte-rerank-v25,0404,980,000,000

行业

通义法睿(法律模型)

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
farui-plus2401,000,000

意图理解

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
tongyi-intent-detect-v31,2001,000,000

角色扮演

  • 华北2(北京)
  • 新加坡
  • 美国(弗吉尼亚)
  • 德国(法兰克福)
  • 日本(东京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
qwen-plus-character120500,000
qwen-flash-character120500,000
qwen-flash-character-2026-02-26120500,000

界面交互

  • 华北2(北京)
模型名称限流条件(超出任一数值时触发限流)
以下为每分钟限流条件,服务可能按 RPS(RPM/60)与 TPS(TPM/60)限制
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
gui-plus80540,000
gui-plus-2026-02-26100540,000

已下线模型

详细信息,请参见 模型下线机制说明
  • 2026年5月13日下线
  • 2026年3月30日下线
  • 2026年1月30日下线
  • 2025年7月30日下线
  • 2025年7月2日下线
  • 2025年5月8日下线
类别模型名称限流条件(超出任一数值时触发限流)
每分钟调用次数(RPM)每分钟消耗Token数(TPM)
含输入与输出Token
千问语言模型qwen-max-latest00
qwen-max-2025-01-25
qwen-max-2024-09-19
qwen-max-2024-04-28
qwen-turbo-latest
qwen-turbo-2025-07-15
qwen-turbo-2025-04-28
qwen-turbo-2025-02-11
qwen-turbo-2024-11-01
qwq-plus-latest
qwq-plus-2025-03-05
千问VLqwen-vl-max-latest
qwen-vl-max-2025-08-13
qwen-vl-max-2025-04-08
qwen-vl-max-2025-04-02
qwen-vl-max-2025-01-25
qwen-vl-max-1230
qwen-vl-max-1119
qwen-vl-plus-latest
qwen-vl-plus-2025-08-15
qwen-vl-plus-2025-07-10
qwen-vl-plus-2025-05-07
qwen-vl-plus-2025-01-25
qwen-vl-plus-0102
qvq-max-latest
qvq-max-2025-05-15
qvq-max-2025-03-25
qvq-plus-latest
qvq-plus-2025-05-15
千问数学模型qwen-math-turbo-latest
qwen-math-turbo-0919
千问Coderqwen-coder-plus-latest
qwen-coder-plus-2024-11-06
qwen-coder-turbo-latest
qwen-coder-turbo-0919
文本生成-千问-开源版qwq-32b
qwq-32b-preview
qvq-72b-preview
qwen2.5-vl-72b-instruct
qwen2.5-vl-32b-instruct
qwen2.5-vl-7b-instruct
qwen2.5-vl-3b-instruct
qwen2.5-7b-instruct-1m
qwen2.5-14b-instruct-1m
qwen2.5-72b-instruct
qwen2.5-32b-instruct
qwen2.5-14b-instruct
qwen2.5-7b-instruct
qwen2.5-math-72b-instruct
qwen2.5-math-7b-instruct
qwen2.5-math-1.5b-instruct
qwen2.5-coder-32b-instruct
qwen2.5-coder-14b-instruct
qwen2.5-coder-7b-instruct
qwen2.5-coder-3b-instruct
qwen2.5-coder-1.5b-instruct
qwen2.5-coder-0.5b-instruct
qwen2.5-3b-instruct
qwen2.5-1.5b-instruct
qwen2.5-0.5b-instruct
qwen3-0.6b
qwen3-1.7b
qwen3-4b
Token Plan
模型体验
  • 3D模型生成
  • 音乐生成
模型调优
模型压缩目录节点
用量统计与性能监控
资产中心
服务支持