综合对比重点
本页不是单纯列价格,而是围绕 Token Plan、Coding Plan、价格对比、额度、额度重置、免费额度、优惠、官网入口、申请入口、Claude Code 平替和 Cursor 接入等搜索场景做综合整理。
通义千问 API 价格怎么算:Qwen-Turbo、Qwen3.7-Plus、Qwen3.7-Max 和 Batch 缓存计费
本文根据 TokenPlan 整理通义千问 API。用户搜索通义千问 API 价格、Qwen API 多少钱、Qwen3.7-Max 怎么收费、Qwen-Turbo 和 Qwen-Plus 怎么选、阿里云百炼 Batch 半价、上下文缓存怎么计费,核心都要回到 DashScope / 百炼的按 token 计费体系。它和工具内 Token Plan 订阅不同,后端服务应使用标准 API Key 与按量余额。
通义千问 API token 价格表:Qwen-Turbo、Qwen3.7-Plus、Qwen3.7-Max 多少钱
套餐信息显示通义千问 API 覆盖阿里系商用 Qwen 模型 id 44 个,不含开源托管章节、日期快照 alias、-us 国际区 id 和第三方模型。价格按输入 tokens、输出 tokens、模型档位和上下文阶梯计算。
| 模型 | 输入价 | 输出价 | 缓存/阶梯备注 | 计价单位 | 适合场景 |
|---|---|---|---|---|---|
| Qwen-Turbo | ¥0.3 | ¥0.6 | 非思考模式;思考模式输出 ¥3 | 百万 tokens | 客服问答、分类、摘要、轻量助手、高并发低成本任务 |
| Qwen3.7-Plus | ¥2 | ¥12 | 0| 百万 tokens | 通用 Agent、应用问答、生产默认模型、质量和成本平衡 | |
| Qwen3.7-Max | ¥12 | ¥36 | 0| 百万 tokens | 复杂推理、长上下文分析、关键业务节点、深度代码任务 | |
| Qwen-Coder-Turbo | ¥2 | ¥6 | 代码 Turbo 档 | 百万 tokens | 高频轻量编程调用、代码补全、脚本生成 |
| QVQ-Plus | ¥2 | ¥5 | 视觉推理 Plus 档 | 百万 tokens | 图文推理、多模态理解、视觉问答 |
| Qwen3.5-OCR | ¥0.5 | ¥2 | OCR 专用模型 | 百万 tokens | 文档识别、票据识别、结构化抽取 |
这张表先回答“多少钱”。真正上线时还要看阶梯计费:部分模型会按单次请求输入总量所在区间给该请求全部 tokens 定价,长上下文请求会比短 prompt 明显更贵。
Qwen-Turbo 适合什么:¥0.3 输入价能不能做默认模型
Qwen-Turbo 是资料中价格最低的通用入口之一。非思考模式输入 ¥0.3、输出 ¥0.6/百万 tokens,思考模式输出 ¥3/百万 tokens。用户搜索“通义千问 API 最便宜模型”时,重点就应该看 Turbo。
| Turbo 使用维度 | 资料摘要 | 选型建议 |
|---|---|---|
| 非思考价格 | 输入 ¥0.3、输出 ¥0.6/百万 tokens | 适合默认低成本路由层 |
| 思考模式 | 输出 ¥3/百万 tokens | 只有需要推理时再开,不要所有请求默认思考 |
| 适合任务 | 客服问答、轻量助手、摘要、分类、自动化脚本 | 高吞吐场景先用 Turbo 控成本 |
| 升级条件 | 质量不足、推理不稳、复杂任务失败 | 再升级到 Plus 或 Max |
如果你的产品是 FAQ、知识库初筛、简单提取、批量脚本或内部工具,Turbo 可以先做默认模型。不要把所有请求直接打到 Max,否则账单会被高价模型拉高。
Qwen3.7-Plus 值不值得用:生产默认模型为什么比 Turbo 更稳
Qwen3.7-Plus 是资料中推荐作为生产主力的中间档。0 如果 Turbo 在复杂问答、上下文理解或 Agent 多轮任务里质量不稳,Plus 是最自然的升级层。它适合作为大多数生产系统的默认主力,而不是只做备用模型。 Qwen3.7-Max 是资料中的旗舰档,0 Max 的价值在复杂任务上。比如长文档分析、代码审查、复杂 Agent 规划、关键业务输出、需要更高稳定性的多步骤任务。普通摘要、分类和轻问答没有必要默认走 Max。 资料明确提到部分模型实行阶梯计费:单价取决于单次请求的输入 token 总量,该请求所有 tokens 都按所在区间单价结算。比如输入 100K 落在 32K–128K 区间,则该请求全部按该档价格计费。 所以通义千问 API 成本优化不能只看“每百万 tokens 单价”。还要控制单次请求的上下文长度,把长文档拆分、摘要或检索后再输入。 套餐信息显示支持 Batch 的模型,其输入和输出均按实时价 50% 计费。Batch 适合可以等待的离线任务,不适合必须实时返回的聊天和交互。 如果你有大量非实时请求,Batch 是比换模型更直接的降本方式。但资料也明确:Batch 与上下文缓存不能同时生效。 上下文缓存适合固定长前缀,Batch 适合离线批量。套餐信息显示上下文缓存可降低输入 token 成本,但 Batch 与缓存不可同时生效。 实时交互、Agent 和客服更适合缓存;离线批量摘要和评测更适合 Batch。不要试图同一批请求同时套两种优惠。 资料模型列表不止 Turbo、Plus、Max,还包含 Qwen-Coder、Qwen-VL、Qwen-OCR、Qwen-Audio、Qwen-MT、Qwen-Math、Qwen-Long、QwQ、QVQ 等专用方向。这些词对 SEO 和用户真实检索都很重要。 如果你的任务是代码,不要只拿 Qwen3.7-Plus 做对比,要看 Coder 系列;如果是 OCR 和票据识别,要看 OCR / VL;如果是音频或实时多模态,要看 Audio / Omni。 套餐信息显示新用户通常有免费额度,但带有效期,不同模型或能力的免费包不一定共享;页面未列明统一固定免费额度。 免费额度适合验证接入和小规模测试,不适合写成稳定生产成本。文章里不应编造固定免费额度数字。 套餐信息显示通义千问 API 支持 DashScope、OpenAI-compatible API、Batch 和 Context Cache。接入时要按后端服务路线处理,而不是拿 Token Plan 订阅 Key 混用。 如果你做 SaaS、企业内部工具或 Agent 后端,应使用 DashScope API Key 和按量余额;如果你只是工具内交互或团队席位管理,再看 Token Plan 订阅。 通义千问最容易被误解的是 API 与 Token Plan。资料显示:标准 API 按 token 从账户余额后付费,Token Plan 团队版是包月 Credits 订阅,面向兼容工具内交互式使用并提供席位管理。 如果你要上线产品,一定按 API 价格表估算;如果你是团队使用工具内模型,再看 Token Plan。二者不要混在一起算成本。 如果只是测试,先看 Turbo、Plus、Max 的单价就够;如果要上线产品,至少要记录输入 tokens、输出 tokens、模型路由比例、阶梯区间、Batch 占比、缓存命中率、失败重试次数和免费额度到期时间。 更稳的策略是:Turbo 做低成本默认层,Plus 做生产主力层,Max 做关键复杂任务层;Coder、VL、OCR、Audio、MT 和 Math 按专用任务分流。这样比所有请求都走 Max 更容易控制成本,也比只用 Turbo 更稳定。 通义千问 API 价格、模型、入口和更新时间可以继续查看 TokenPlan 厂商详情页。可视化页面适合快速分享和横向比较。 可视化页面:https://tokenplan.pw/qianwen-token-api/
Plus 使用维度 资料摘要 选型建议
代表价格 输入 ¥2、输出 ¥12/百万 tokens 比 Turbo 贵,但更适合稳定生产 能力定位 推理、视觉理解、文本生成 通用 Agent 和应用问答优先看 Plus 阶梯计费 256K 以上长上下文进入更高价区间 长文档任务要单独估算 成本策略 Batch 半价,缓存降低输入成本 离线任务用 Batch,重复长前缀用缓存 Qwen3.7-Max 价格为什么高:旗舰模型适合哪些复杂任务
Max 使用维度 资料摘要 选型建议
代表价格 输入 ¥12、输出 ¥36/百万 tokens 高价模型,不适合全量流量默认使用 任务定位 复杂推理、长上下文、编程、多步 Agent 放在关键节点更划算 上下文 0 长上下文强,但成本要按输入总量估算 路由策略 Turbo / Plus 失败或低置信时升级 用 Max 处理难任务,而不是普通问答 通义千问阶梯计费怎么算:为什么长上下文请求会更贵
阶梯计费问题 用户容易误解的点 正确理解
是否只对超出部分加价 很多人以为只有超出部分贵 源头 FAQ 说明该请求所有 tokens 按区间价结算 长上下文影响 只看模型基础价 长 prompt 会让整个请求进入更高价区间 多轮对话 觉得每轮很短 上下文累计后可能整体变长 代码库任务 一次塞很多文件 可能直接进入高价阶梯 成本优化 只换便宜模型 还要做检索、摘要、上下文裁剪和缓存 通义千问 Batch 半价怎么用:离线摘要、批量评测和数据处理更划算
Batch 使用场景 为什么适合 注意事项
批量摘要 大量文档统一处理,不要求立即返回 可把输入输出成本降到实时价 50% 批量标注 数据集打标签、分类、质检 要设计稳定 prompt,减少返工 离线评测 模型输出评分、自动测试、对比评估 适合夜间或队列任务 内容清洗 文本规范化、字段抽取、格式转换 结果可异步落库 不适合任务 实时客服、IDE、用户对话 等待时间不适合强交互 通义千问上下文缓存怎么省钱:为什么 Batch 和缓存不能叠加
缓存场景 适合缓存的原因 选型提醒
固定 system prompt 每次请求重复出现 命中后降低输入成本 工具说明 Agent 工具列表、函数 schema 固定 适合工具调用和开发者平台 长背景资料 业务规则、产品说明、知识库摘要反复使用 适合高频同类任务 代码项目背景 架构说明、关键文件摘要、规范文档 适合 Coder / Agent 工作流 与 Batch 对比 Batch 打 5 折,缓存降低输入 同一请求二选一,不能叠加 Qwen-Coder、Qwen-VL、Qwen-OCR 和 Qwen-Audio 怎么选
模型方向 资料中的模型 适合场景
代码模型 Qwen3-Coder-Next、Qwen3-Coder-Plus、Qwen-Coder-Turbo 代码生成、代码审查、研发 Agent、IDE 辅助 视觉语言 Qwen3-VL-Plus、Qwen3-VL-Flash、Qwen-VL-Max、Qwen-VL-Plus、Qwen-VL-OCR 图文理解、图片问答、OCR、票据和截图分析 OCR Qwen3.5-OCR,输入 ¥0.5、输出 ¥2/百万 tokens 文档识别、表格抽取、发票票据结构化 音频 Qwen-Audio-Chat、Qwen-Audio-Turbo、Qwen-Omni 系列 音频对话、语音理解、多模态交互 翻译 Qwen-MT-Flash、Qwen-MT-Lite、Qwen-MT-Plus、Qwen-MT-Turbo 多语言翻译、本地化、批量文本转换 数学/推理 Qwen-Math-Plus、Qwen-Math-Turbo、QwQ-Plus、QVQ-Max、QVQ-Plus 数学题、视觉推理、复杂解题和多步推理 Qwen API 免费额度怎么理解:新用户免费包、有效期和模型不共享
免费额度问题 资料显示 用户建议
是否一定有免费额度 通常有,但不是统一固定金额 以百炼控制台余额和免费资源包为准 是否所有模型共享 不一定共享 上线前逐项确认模型免费包 是否长期有效 带有效期 测试期要记录到期时间 能不能按免费额度上线 不建议 生产要按付费价格估算 免费额度用完后 转为按量余额扣费 要设置预算、告警和限流 通义千问 API 怎么接入:DashScope、OpenAI-compatible API、Context Cache 和 Batch
接入方式 资料依据 配置重点
DashScope supportedTools 记录 DashScope 阿里云百炼标准 API Key、余额和限流 OpenAI-compatible API supportedTools 记录 OpenAI-compatible API 适合迁移 OpenAI SDK、网关和现有应用 Batch supportedTools 记录 Batch 离线任务半价,异步处理 Context Cache supportedTools 记录 Context Cache 重复长前缀降输入成本 Token Plan 团队版 源头说明与 API 完全分离 包月 Credits 和工具内交互,不是后端 API 余额 通义千问 API 和 Token Plan 有什么区别:Key 不可互换,成本不能混算
对比项 标准 Qwen API Token Plan 团队版
计费方式 按输入、输出、Batch、缓存等 token 项计费 包月 Credits 订阅和席位管理 使用入口 DashScope / 阿里云百炼 API 兼容工具内交互使用 适合场景 自建应用后端、SaaS、Agent 服务、批量任务 团队协作、工具内交互、订阅额度管理 Key 关系 DashScope API Key Token Plan 订阅 Key 是否互通 不可互换 不可互换 通义千问 API 成本怎么估算:上线前要记录哪些指标
通义千问价格和入口在哪里核对
FAQ 常见问题
通义千问 API 最低多少钱?
套餐信息显示 Qwen-Turbo 非思考模式输入 ¥0.3、输出 ¥0.6/百万 tokens;思考模式输出 ¥3/百万 tokens。它适合轻量问答、摘要、分类、工具助手和高并发低成本流量。
Qwen3.7-Plus 和 Qwen3.7-Max 怎么选?
Qwen3.7-Plus 在 0<Token≤256K 代表低档为输入 ¥2、输出 ¥12/百万 tokens,更适合生产默认;Qwen3.7-Max 在 0<Token≤1M 档为输入 ¥12、输出 ¥36/百万 tokens,更适合复杂推理、长上下文和关键业务节点。
通义千问 Batch 和上下文缓存能同时用吗?
不能。套餐信息显示 Batch 调用输入输出均按实时价 50% 计费,上下文缓存只降低输入 token 成本,但 Batch 与缓存不可同时生效,需要按实时任务、离线任务和缓存命中率二选一。
通义千问 API 有免费额度吗?
套餐信息显示新用户通常有免费额度并带有效期,不同模型或能力的免费包不一定共享,但页面未列明统一固定免费额度。上线前应在百炼控制台核对余额和免费资源明细。
通义千问 API 和 Token Plan 订阅有什么区别?
标准 API 按 token 从 DashScope / 百炼账户余额扣费,适合自建后端;Token Plan 团队版是包月 Credits 订阅,面向工具内交互和席位管理。两者 Key 不可互换。