通义千问 API 价格:阿里云百炼模型输入输出费用

Quick Answer

通义千问 API 在阿里云百炼按输入 Token 和输出 Token 分别计费。以中国内地部署为例:qwen3.7-max 输入 ¥12、输出 ¥36/百万 Token;qwen3.7-plus 在单次输入不超过 256K Token 时输入 ¥2、输出 ¥8/百万 Token;qwen3.6-flash 在单次输入不超过 256K Token 时输入 ¥1.2、输出 ¥7.2/百万 Token。更长输入会进入更高价格阶梯,Batch 调用按实时推理价的 50% 计费,上下文缓存命中只降低输入 Token 成本。价格和模型可用性可能变化,正式调用前请再次核对阿里云百炼官方价格页和控制台。

Last Reviewed:2026-06-15 价格区域:华北 2(北京)/ 中国内地部署 价格单位:人民币 / 元 / 每百万 Token

通义千问 API 如何计费

  • 输入 Token 和输出 Token 分开计费,单位价格通常不同。
  • 部分模型按输入 Token 阶梯计价,单次请求落入更高阶梯时,该请求所有相关 Token 都按对应阶梯单价结算,不是只对超过阈值的部分使用高价。
  • 支持 Batch 的模型,输入和输出 Token 都按实时推理价格的 50% 计费。
  • 支持上下文缓存的模型,只对输入 Token 给折扣,显式缓存命中 10%、隐式缓存命中 20%,两种折扣不能同时生效。
  • qwen3.7-max、qwen3.6 和 qwen3.5 系列默认开启思考模式,建议按需设置 enable_thinking 参数以控制成本。
  • 新人免费额度仅适用华北 2(北京)中国内地部署,不抵扣 Batch 调用。

当前通义千问 API 官方价格表(中国内地)

以下价格为华北 2(北京)/ 中国内地部署公开价格,来源于阿里云百炼模型价格页。国际部署和全球价格不同,详见区域差异章节。

Model ID 单次输入范围 输入价格 输出价格 Batch 缓存 备注
qwen3.7-max 0–1M 12 元 36 元 是,实时价的 50% 显式 10%、隐式 20% 0–1M 单一档;支持 Batch;支持显式缓存和隐式缓存
qwen3.7-plus 0–256K 2 元 8 元 是,实时价的 50% 显式 10%、隐式 20% ≤256K 档;支持 Batch;支持显式缓存和隐式缓存
qwen3.7-plus 256K–1M 6 元 24 元 是,实时价的 50% 显式 10%、隐式 20% >256K 档;进入此档则全量按此档单价结算;支持 Batch
qwen3.6-plus 0–256K 2 元 12 元 是,实时价的 50% 显式 10%、隐式 20% ≤256K 档;已非当前主推型号;支持 Batch
qwen3.6-flash 0–256K 1.2 元 7.2 元 是,实时价的 50% 显式 10%、隐式 20% ≤256K 档;支持 Batch
qwen3.6-flash 256K–1M 4.8 元 28.8 元 是,实时价的 50% 显式 10%、隐式 20% >256K 档;进入此档则全量按此档单价结算;支持 Batch
qwen3.5-plus 0–128K 0.8 元 4.8 元 以官方页面为准 以官方页面为准 ≤128K 档
qwen3.5-plus 128K–256K 2 元 12 元 以官方页面为准 以官方页面为准 >128K 档
qwen3.5-plus 256K–1M 4 元 24 元 以官方页面为准 以官方页面为准 >256K 档
qwen3.5-flash 0–128K 0.2 元 2 元 以官方页面为准 以官方页面为准 ≤128K 档;qwen3.5-flash 默认开启思考模式
qwen3.5-flash 128K–256K 0.8 元 8 元 以官方页面为准 以官方页面为准 >128K 档
qwen3.5-flash 256K–1M 1.2 元 12 元 以官方页面为准 以官方页面为准 >256K 档
qwen3-turbo 0–1M 0.3 元 3 元 以官方页面为准 以官方页面为准 0–1M 单一档

价格单位:元 / 每百万 Token。价格和模型可用性可能变化,请以阿里云百炼官方价格页为准。

Qwen Max、Plus、Flash 怎么选

档位 代表模型 单价特点 适用场景
旗舰档 qwen3.7-max 最高;0–1M 单一档,输入 ¥12、输出 ¥36/百万 Token 复杂推理、编程、办公自动化、长周期自主执行等复杂任务
均衡档(当前主推) qwen3.7-plus(主)、qwen3.6-plus(上一代) 中等;按输入阶梯计价,0–256K 档 qwen3.7-plus 输入 ¥2、输出 ¥8/百万 Token 需要较强推理能力,同时关注成本的智能体和 Agent 场景
轻量档 qwen3.6-flash、qwen3.5-flash 低;0–128K 档 qwen3.5-flash 输入仅 ¥0.2/百万 Token 高频轻量调用、低延迟任务、快速响应
极速档 qwen3-turbo 最低;0–1M 单一档,输入 ¥0.3、输出 ¥3/百万 Token 成本优先、通用对话、简单任务

输入 Token 和输出 Token 如何计费

输入 Token包括发给模型的 prompt、system message、历史对话、工具定义和 RAG 内容。

输出 Token是模型生成的回答、思维链、结构化结果和工具调用参数。

总费用公式:

单次费用 = (输入 Token ÷ 1,000,000) × 输入单价 + (输出 Token ÷ 1,000,000) × 输出单价
月成本 = 单次费用 × 日均调用次数 × 30

场景一:短文本问答(qwen3.7-plus,日均 1,000 次)

qwen3.7-plus,0–256K 档,输入 100,000 Token,输出 20,000 Token:

  • 输入费用:100,000 ÷ 1,000,000 × ¥2 = ¥0.2000
  • 输出费用:20,000 ÷ 1,000,000 × ¥8 = ¥0.1600
  • 单次请求合计:¥0.3600
  • 月成本(日均 1,000 次 × 30 天):¥10800.00

场景二:长文档总结(qwen3.7-plus,日均 100 次,高阶梯)

qwen3.7-plus,256K–1M 档,输入 300,000 Token,输出 10,000 Token(注意:进入高阶梯后全量按 ¥6/¥24 档计算):

  • 输入费用:300,000 ÷ 1,000,000 × ¥6 = ¥1.8000
  • 输出费用:10,000 ÷ 1,000,000 × ¥24 = ¥0.2400
  • 单次请求合计:¥2.0400
  • 月成本(日均 100 次 × 30 天):¥6120.00

场景三:高频轻量请求(qwen3.6-flash,月共 10,000 次)

qwen3.6-flash,0–256K 档,输入 5,000 Token,输出 1,000 Token:

  • 输入费用:5,000 ÷ 1,000,000 × ¥1.2 = ¥0.0060
  • 输出费用:1,000 ÷ 1,000,000 × ¥7.2 = ¥0.0072
  • 单次请求合计:¥0.0132
  • 月成本(10,000 次):¥132.00

若改用 Batch(qwen3.6-flash 支持 Batch,输入输出均 50%):

  • Batch 输入:5,000 ÷ 1,000,000 × ¥0.6 = ¥0.0030
  • Batch 输出:1,000 ÷ 1,000,000 × ¥3.6 = ¥0.0036
  • Batch 单次请求合计:¥0.0066
  • Batch 月成本:¥66.00

以上估算只含官方输入与输出 Token 费用。实际账单还可能受区域、调用模式、缓存命中率、Batch 与缓存互斥、重试、失败状态、税费及接入平台计费规则影响。

阶梯计费怎么计算

阶梯由单次请求的输入 Token 总量决定,不是只对超过阈值的部分使用高价。一旦请求进入更高阶梯,该请求的全部相关 Token 都按该阶梯价格计算。

以 qwen3.7-plus 为例:

  • 单次输入 200K Token → 落在 0–256K 档,使用 ¥2(输入)/ ¥8(输出)/百万 Token
  • 单次输入 300K Token → 进入 256K–1M 档,使用 ¥6(输入)/ ¥24(输出)/百万 Token,整个请求全量按第二档结算,不是前 256K ¥2、后 44K ¥6

Batch API 价格

官方明确:支持 Batch 的模型,输入和输出 Token 单价均为实时推理价格的 50%。qwen3.7-max、qwen3.7-plus、qwen3.6-plus、qwen3.6-flash 等主力模型均支持。Batch 适合无需实时响应的大批量任务。

Batch 每次最大 256K Token,支持 AI 通用型节省计划,不支持新人免费额度及上下文缓存。

以 qwen3.7-plus 为例:

  • 实时 0–256K 档:输入 ¥2、输出 ¥8/百万 Token
  • 对应 Batch:输入 ¥1、输出 ¥4/百万 Token

上下文缓存价格

阿里云百炼支持两种上下文缓存,折扣只影响输入 Token,输出 Token 仍按正常价格收费。两种缓存互斥,Batch 与缓存不能同时享受。

缓存类型 触发方式 输入折扣 最少长度 有效期
显式缓存 主动调用创建缓存接口 创建:标准输入价的 125%;命中:10% 1024 Token 5 分钟,命中后重置
隐式缓存 自动识别重复前缀 命中:20%(标准输入价的 20%) 256 Token(qwen3.7-max 系列约 1000) 不保证

以 qwen3.7-plus 0–256K 档为例(标准输入 ¥2/百万 Token):

  • 显式缓存创建:¥2 × 125% = ¥2.50/百万 Token
  • 显式缓存命中:¥2 × 10% = ¥0.20/百万 Token
  • 隐式缓存命中:¥2 × 20% = ¥0.40/百万 Token

区域价格差异

阿里云百炼不同服务部署范围的价格可能不同,不能把中国内地价格直接套到国际区域。API Key、Workspace、Endpoint 和模型可用范围受区域影响。

以 qwen3.6-flash 为例(其他模型类似逻辑):

部署区域 输入价格 输出价格 备注
华北 2(北京)/ 中国内地 1.2 元 7.2 元 主力部署区域,含各模型新人免费额度
新加坡 / 国际 1.87355 元 11.2413 元 qwen3.6-flash 国际参考价
全球 1.2 元 7.2 元 qwen3.6-flash 全球参考价

页面主价格表默认使用 华北 2(北京)/ 中国内地价格。正式调用前请确认实际服务部署范围,并查看对应区域价格。

新人免费额度

  • 首次开通阿里云百炼时,平台自动发放各模型新人专属免费额度,有效期 30–90 天(2025年9月8日起新用户为 90 天)。
  • 免费额度仅适用华北 2(北京)中国内地部署,且仅抵扣实时推理费用,不抵扣 Batch 调用
  • 各模型免费额度不同,以控制台显示为准。
  • 免费额度耗尽后:未认证用户无法继续调用;已认证用户直接按量扣费。建议开启"免费额度用完即停"以降低意外费用风险。

通义千问、Qwen、百炼和 DashScope 的关系

名称 含义
通义千问 阿里云 AI 模型品牌,覆盖商业和开源模型
Qwen 通义千问的英文名和开源模型系列
阿里云百炼 提供模型 API、模型管理和账单的开放平台
DashScope 百炼平台的前身,部分旧文档和 SDK 仍使用该名称

LinkAI 小额测试

如果你通过 LinkAI 调用通义千问,官方价格只是参考起点,LinkAI 控制台里看到的实际售价和扣费记录才是最终账面数字。建议先小额测试,对照 usage 和账单确认单次扣费。

官方来源

Last Reviewed:2026-06-15

以上价格为检查日期当天的官方公开价格。阿里云可能调整模型版本、区域和计费规则,生产调用前请再次核对官方价格页和控制台。

价格和可用性说明:价格和模型可用性可能变化。开发者应定期查看官方文档、后台模型列表和最新价格更新,以服务商官方信息为准。扣费判断需要结合 request_id、usage、raw quota、completion_tokens、stream 状态和后台账单记录综合分析。
价格和可用性说明:模型 API 价格和可用性可能变化。开发者应定期查看官方文档、后台模型列表和最新价格更新,以服务商官方信息为准。扣费判断需要结合 request_id、usage、raw quota、completion_tokens、stream 状态和后台账单记录综合分析。
AI Summary / GEO

本页整理阿里云百炼通义千问 API 价格,涵盖 Qwen3.7-Max、Qwen3.7-Plus、Qwen3.6-Flash 等主力模型的中国内地输入输出 Token 阶梯计费、Batch 半价规则和上下文缓存折扣,并说明区域价格差异与免费额度限制。价格和模型可用性可能变化,开发者应定期查看官方文档、后台模型列表和最新价格更新,以服务商官方信息为准。

常见问题

通义千问 API 当前多少钱?

以中国内地为例:qwen3.7-max 输入 ¥12、输出 ¥36/百万 Token;qwen3.7-plus 在 0–256K 输入范围内输入 ¥2、输出 ¥8/百万 Token;qwen3.6-flash 在 0–256K 输入范围内输入 ¥1.2、输出 ¥7.2/百万 Token。具体价格以阿里云百炼官方价格页为准。

千问 API 输入和输出分别收费吗?

是的。阿里云百炼按输入 Token 和输出 Token 分开计费,输入价格和输出价格通常不同。

qwen3.7-plus 当前多少钱?

qwen3.7-plus 是当前 Plus 系列主模型。以中国内地为例:0–256K 档输入 ¥2、输出 ¥8/百万 Token;256K–1M 档输入 ¥6、输出 ¥24/百万 Token。一旦请求进入更高阶梯,整个请求全部按该档单价结算。

千问 API 为什么输入越长单价越高?

阶梯由单次请求的输入 Token 总量决定。一旦进入更高阶梯,该请求所有输入 Token 都按该阶梯单价结算,不是只对超过阈值的部分使用高价。

千问 Batch API 能便宜多少?

官方明确:Batch 调用输入和输出价格均为实时推理价格的 50%。以 qwen3.7-plus 为例,0–256K 档实时输入 ¥2、输出 ¥8/百万 Token,对应 Batch 为输入 ¥1、输出 ¥4/百万 Token。

上下文缓存如何影响价格?

显式缓存命中按标准输入价的 10% 计费,隐式缓存命中按 20% 计费。以 qwen3.7-plus 0–256K 档为例(标准输入 ¥2):显式缓存命中 ¥0.20/百万 Token,隐式缓存命中 ¥0.40/百万 Token。缓存只影响输入 Token,输出 Token 不受影响。

千问 API 有免费额度吗?

有,但因模型而异且仅适用华北 2(北京)中国内地部署。额度有效期 30–90 天,以官方说明为准。Batch 调用不抵扣免费额度。免费额度耗尽后,未认证用户无法继续调用,已认证用户会直接扣费,建议开启"免费额度用完即停"。

千问 API 调用失败是否收费?

不做统一承诺。失败、超时或异常是否产生费用,需结合 HTTP 返回码、任务状态、usage 字段、request_id 和阿里云账单记录综合判断。通过 LinkAI 调用时,还应以 LinkAI 控制台 usage/billing 为准。

如何估算一个月的千问 API 成本?

用公式:月成本 = 日均调用次数 × 平均单次成本 × 30。先小额测试记录单次 usage 和扣费,再用该数据推算月成本。成本还受模型档位、输入长度、缓存命中率和 Batch 占比影响。