Quick Answer
通义千问 API 在阿里云百炼按输入 Token 和输出 Token 分别计费。以中国内地部署为例:qwen3.7-max 输入 ¥12、输出 ¥36/百万 Token;qwen3.7-plus 在单次输入不超过 256K Token 时输入 ¥2、输出 ¥8/百万 Token;qwen3.6-flash 在单次输入不超过 256K Token 时输入 ¥1.2、输出 ¥7.2/百万 Token。更长输入会进入更高价格阶梯,Batch 调用按实时推理价的 50% 计费,上下文缓存命中只降低输入 Token 成本。价格和模型可用性可能变化,正式调用前请再次核对阿里云百炼官方价格页和控制台。
通义千问 API 如何计费
- 输入 Token 和输出 Token 分开计费,单位价格通常不同。
- 部分模型按输入 Token 阶梯计价,单次请求落入更高阶梯时,该请求所有相关 Token 都按对应阶梯单价结算,不是只对超过阈值的部分使用高价。
- 支持 Batch 的模型,输入和输出 Token 都按实时推理价格的 50% 计费。
- 支持上下文缓存的模型,只对输入 Token 给折扣,显式缓存命中 10%、隐式缓存命中 20%,两种折扣不能同时生效。
- qwen3.7-max、qwen3.6 和 qwen3.5 系列默认开启思考模式,建议按需设置 enable_thinking 参数以控制成本。
- 新人免费额度仅适用华北 2(北京)中国内地部署,不抵扣 Batch 调用。
当前通义千问 API 官方价格表(中国内地)
以下价格为华北 2(北京)/ 中国内地部署公开价格,来源于阿里云百炼模型价格页。国际部署和全球价格不同,详见区域差异章节。
| Model ID | 单次输入范围 | 输入价格 | 输出价格 | Batch | 缓存 | 备注 |
|---|---|---|---|---|---|---|
qwen3.7-max | 0–1M | 12 元 | 36 元 | 是,实时价的 50% | 显式 10%、隐式 20% | 0–1M 单一档;支持 Batch;支持显式缓存和隐式缓存 |
qwen3.7-plus | 0–256K | 2 元 | 8 元 | 是,实时价的 50% | 显式 10%、隐式 20% | ≤256K 档;支持 Batch;支持显式缓存和隐式缓存 |
qwen3.7-plus | 256K–1M | 6 元 | 24 元 | 是,实时价的 50% | 显式 10%、隐式 20% | >256K 档;进入此档则全量按此档单价结算;支持 Batch |
qwen3.6-plus | 0–256K | 2 元 | 12 元 | 是,实时价的 50% | 显式 10%、隐式 20% | ≤256K 档;已非当前主推型号;支持 Batch |
qwen3.6-flash | 0–256K | 1.2 元 | 7.2 元 | 是,实时价的 50% | 显式 10%、隐式 20% | ≤256K 档;支持 Batch |
qwen3.6-flash | 256K–1M | 4.8 元 | 28.8 元 | 是,实时价的 50% | 显式 10%、隐式 20% | >256K 档;进入此档则全量按此档单价结算;支持 Batch |
qwen3.5-plus | 0–128K | 0.8 元 | 4.8 元 | 以官方页面为准 | 以官方页面为准 | ≤128K 档 |
qwen3.5-plus | 128K–256K | 2 元 | 12 元 | 以官方页面为准 | 以官方页面为准 | >128K 档 |
qwen3.5-plus | 256K–1M | 4 元 | 24 元 | 以官方页面为准 | 以官方页面为准 | >256K 档 |
qwen3.5-flash | 0–128K | 0.2 元 | 2 元 | 以官方页面为准 | 以官方页面为准 | ≤128K 档;qwen3.5-flash 默认开启思考模式 |
qwen3.5-flash | 128K–256K | 0.8 元 | 8 元 | 以官方页面为准 | 以官方页面为准 | >128K 档 |
qwen3.5-flash | 256K–1M | 1.2 元 | 12 元 | 以官方页面为准 | 以官方页面为准 | >256K 档 |
qwen3-turbo | 0–1M | 0.3 元 | 3 元 | 以官方页面为准 | 以官方页面为准 | 0–1M 单一档 |
价格单位:元 / 每百万 Token。价格和模型可用性可能变化,请以阿里云百炼官方价格页为准。
Qwen Max、Plus、Flash 怎么选
| 档位 | 代表模型 | 单价特点 | 适用场景 |
|---|---|---|---|
| 旗舰档 | qwen3.7-max | 最高;0–1M 单一档,输入 ¥12、输出 ¥36/百万 Token | 复杂推理、编程、办公自动化、长周期自主执行等复杂任务 |
| 均衡档(当前主推) | qwen3.7-plus(主)、qwen3.6-plus(上一代) | 中等;按输入阶梯计价,0–256K 档 qwen3.7-plus 输入 ¥2、输出 ¥8/百万 Token | 需要较强推理能力,同时关注成本的智能体和 Agent 场景 |
| 轻量档 | qwen3.6-flash、qwen3.5-flash | 低;0–128K 档 qwen3.5-flash 输入仅 ¥0.2/百万 Token | 高频轻量调用、低延迟任务、快速响应 |
| 极速档 | qwen3-turbo | 最低;0–1M 单一档,输入 ¥0.3、输出 ¥3/百万 Token | 成本优先、通用对话、简单任务 |
输入 Token 和输出 Token 如何计费
输入 Token包括发给模型的 prompt、system message、历史对话、工具定义和 RAG 内容。
输出 Token是模型生成的回答、思维链、结构化结果和工具调用参数。
总费用公式:
月成本 = 单次费用 × 日均调用次数 × 30
场景一:短文本问答(qwen3.7-plus,日均 1,000 次)
qwen3.7-plus,0–256K 档,输入 100,000 Token,输出 20,000 Token:
- 输入费用:100,000 ÷ 1,000,000 × ¥2 = ¥0.2000
- 输出费用:20,000 ÷ 1,000,000 × ¥8 = ¥0.1600
- 单次请求合计:¥0.3600
- 月成本(日均 1,000 次 × 30 天):¥10800.00
场景二:长文档总结(qwen3.7-plus,日均 100 次,高阶梯)
qwen3.7-plus,256K–1M 档,输入 300,000 Token,输出 10,000 Token(注意:进入高阶梯后全量按 ¥6/¥24 档计算):
- 输入费用:300,000 ÷ 1,000,000 × ¥6 = ¥1.8000
- 输出费用:10,000 ÷ 1,000,000 × ¥24 = ¥0.2400
- 单次请求合计:¥2.0400
- 月成本(日均 100 次 × 30 天):¥6120.00
场景三:高频轻量请求(qwen3.6-flash,月共 10,000 次)
qwen3.6-flash,0–256K 档,输入 5,000 Token,输出 1,000 Token:
- 输入费用:5,000 ÷ 1,000,000 × ¥1.2 = ¥0.0060
- 输出费用:1,000 ÷ 1,000,000 × ¥7.2 = ¥0.0072
- 单次请求合计:¥0.0132
- 月成本(10,000 次):¥132.00
若改用 Batch(qwen3.6-flash 支持 Batch,输入输出均 50%):
- Batch 输入:5,000 ÷ 1,000,000 × ¥0.6 = ¥0.0030
- Batch 输出:1,000 ÷ 1,000,000 × ¥3.6 = ¥0.0036
- Batch 单次请求合计:¥0.0066
- Batch 月成本:¥66.00
以上估算只含官方输入与输出 Token 费用。实际账单还可能受区域、调用模式、缓存命中率、Batch 与缓存互斥、重试、失败状态、税费及接入平台计费规则影响。
阶梯计费怎么计算
阶梯由单次请求的输入 Token 总量决定,不是只对超过阈值的部分使用高价。一旦请求进入更高阶梯,该请求的全部相关 Token 都按该阶梯价格计算。
以 qwen3.7-plus 为例:
- 单次输入 200K Token → 落在 0–256K 档,使用 ¥2(输入)/ ¥8(输出)/百万 Token
- 单次输入 300K Token → 进入 256K–1M 档,使用 ¥6(输入)/ ¥24(输出)/百万 Token,整个请求全量按第二档结算,不是前 256K ¥2、后 44K ¥6
Batch API 价格
官方明确:支持 Batch 的模型,输入和输出 Token 单价均为实时推理价格的 50%。qwen3.7-max、qwen3.7-plus、qwen3.6-plus、qwen3.6-flash 等主力模型均支持。Batch 适合无需实时响应的大批量任务。
Batch 每次最大 256K Token,支持 AI 通用型节省计划,不支持新人免费额度及上下文缓存。
以 qwen3.7-plus 为例:
- 实时 0–256K 档:输入 ¥2、输出 ¥8/百万 Token
- 对应 Batch:输入 ¥1、输出 ¥4/百万 Token
上下文缓存价格
阿里云百炼支持两种上下文缓存,折扣只影响输入 Token,输出 Token 仍按正常价格收费。两种缓存互斥,Batch 与缓存不能同时享受。
| 缓存类型 | 触发方式 | 输入折扣 | 最少长度 | 有效期 |
|---|---|---|---|---|
| 显式缓存 | 主动调用创建缓存接口 | 创建:标准输入价的 125%;命中:10% | 1024 Token | 5 分钟,命中后重置 |
| 隐式缓存 | 自动识别重复前缀 | 命中:20%(标准输入价的 20%) | 256 Token(qwen3.7-max 系列约 1000) | 不保证 |
以 qwen3.7-plus 0–256K 档为例(标准输入 ¥2/百万 Token):
- 显式缓存创建:¥2 × 125% = ¥2.50/百万 Token
- 显式缓存命中:¥2 × 10% = ¥0.20/百万 Token
- 隐式缓存命中:¥2 × 20% = ¥0.40/百万 Token
区域价格差异
阿里云百炼不同服务部署范围的价格可能不同,不能把中国内地价格直接套到国际区域。API Key、Workspace、Endpoint 和模型可用范围受区域影响。
以 qwen3.6-flash 为例(其他模型类似逻辑):
| 部署区域 | 输入价格 | 输出价格 | 备注 |
|---|---|---|---|
| 华北 2(北京)/ 中国内地 | 1.2 元 | 7.2 元 | 主力部署区域,含各模型新人免费额度 |
| 新加坡 / 国际 | 1.87355 元 | 11.2413 元 | qwen3.6-flash 国际参考价 |
| 全球 | 1.2 元 | 7.2 元 | qwen3.6-flash 全球参考价 |
页面主价格表默认使用 华北 2(北京)/ 中国内地价格。正式调用前请确认实际服务部署范围,并查看对应区域价格。
新人免费额度
- 首次开通阿里云百炼时,平台自动发放各模型新人专属免费额度,有效期 30–90 天(2025年9月8日起新用户为 90 天)。
- 免费额度仅适用华北 2(北京)中国内地部署,且仅抵扣实时推理费用,不抵扣 Batch 调用。
- 各模型免费额度不同,以控制台显示为准。
- 免费额度耗尽后:未认证用户无法继续调用;已认证用户直接按量扣费。建议开启"免费额度用完即停"以降低意外费用风险。
通义千问、Qwen、百炼和 DashScope 的关系
| 名称 | 含义 |
|---|---|
| 通义千问 | 阿里云 AI 模型品牌,覆盖商业和开源模型 |
| Qwen | 通义千问的英文名和开源模型系列 |
| 阿里云百炼 | 提供模型 API、模型管理和账单的开放平台 |
| DashScope | 百炼平台的前身,部分旧文档和 SDK 仍使用该名称 |
LinkAI 小额测试
如果你通过 LinkAI 调用通义千问,官方价格只是参考起点,LinkAI 控制台里看到的实际售价和扣费记录才是最终账面数字。建议先小额测试,对照 usage 和账单确认单次扣费。
官方来源
Last Reviewed:2026-06-15
以上价格为检查日期当天的官方公开价格。阿里云可能调整模型版本、区域和计费规则,生产调用前请再次核对官方价格页和控制台。