综合对比重点
本页不是单纯列价格,而是围绕 Token Plan、Coding Plan、价格对比、额度、额度重置、免费额度、优惠、官网入口、申请入口、Claude Code 平替和 Cursor 接入等搜索场景做综合整理。
DeepSeek API 价格怎么算:V4-Flash、V4-Pro、缓存命中和 1M 上下文对比
本文根据 TokenPlan 整理 DeepSeek API。用户搜索 DeepSeek API 多少钱、DeepSeek-V4-Flash 和 V4-Pro 怎么选、DeepSeek 缓存命中价怎么算、DeepSeek 有没有包月套餐、DeepSeek 怎么接 Claude Code 或 Cursor,本质都在问同一件事:官方 API 是按量计费,不是包月;成本由输入 tokens、输出 tokens、缓存命中率、模型选择、并发和失败重试共同决定。
DeepSeek API token 价格表:V4-Flash 和 V4-Pro 输入输出多少钱
DeepSeek 官方在资料中记录的当前主力模型是 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro。两者都支持 1M 超长上下文、最大 384K 输出、思考/非思考双模式、JSON Output、Tool Calls 和对话前缀续写,区别主要在单价、并发和适合任务。
| 模型 | 输入价 | 输出价 | 缓存命中输入价 | 并发上限 | 适合场景 |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash | ¥1 | ¥2 | ¥0.02 | 2500 | 高频批量、轻量补全、成本敏感 Agent、日志分析、自建后端基础流量 |
| DeepSeek-V4-Pro | ¥3 | ¥6 | ¥0.025 | 500 | 复杂推理、深度代码改造、长链路 Agent、核心生产后端、高价值任务 |
这张表先回答“多少钱”。真正上线时还要看输出长度和缓存命中率。DeepSeek 的输出价高于输入价,如果 Agent 经常长回答或失败重试,账单会比只看输入价时高很多。
DeepSeek-V4-Flash 适合什么:低价高并发模型能不能做主力
V4-Flash 是 DeepSeek 官方 API 的低价高并发档。套餐信息显示它缓存未命中输入 ¥1、输出 ¥2/百万 tokens,缓存命中输入 ¥0.02/百万 tokens,并发上限 2500。
| Flash 维度 | 资料摘要 | 选型建议 |
|---|---|---|
| 价格 | 输入 ¥1、输出 ¥2/百万 tokens | 可作为默认路由层,承接大量普通请求 |
| 缓存命中 | 输入 ¥0.02/百万 tokens | 重复 system prompt、长前缀和固定工具说明要设计缓存 |
| 并发 | 账号粒度并发 2500 | 适合高频批量、自动化脚本和多用户基础流量 |
| 上下文 | 1M 上下文,最大 384K 输出 | 可处理长文档和长对话,但要控制输出成本 |
| 模式 | 默认思考模式,可切非思考模式 | 轻任务可用非思考,复杂任务再启用思考 |
如果你的任务是分类、摘要、格式整理、日志分析、轻量问答、低成本 Agent 或批量处理,V4-Flash 可以先做主力。它不是“低价就低质”的定位,而是更适合大多数高频普通请求。
DeepSeek-V4-Pro 值不值得用:复杂推理和代码任务为什么要升级
V4-Pro 是官方旗舰档,套餐信息显示输入 ¥3、输出 ¥6/百万 tokens,缓存命中输入 ¥0.025/百万 tokens,并发上限 500。它比 Flash 贵,但适合更难的推理和代码任务。
| Pro 维度 | 资料摘要 | 选型建议 |
|---|---|---|
| 价格 | 输入 ¥3、输出 ¥6/百万 tokens | 用在复杂任务,不建议全量默认走 Pro |
| 缓存命中 | 输入 ¥0.025/百万 tokens | 固定上下文场景仍可通过缓存压低输入成本 |
| 并发 | 账号粒度并发 500 | 比 Flash 低,生产系统要做队列和降级 |
| 适合任务 | 复杂推理、深度代码改造、长链路 Agent | 放在关键节点、失败重试或高价值请求上更合理 |
| 输出 | 最大 384K 输出 | 长输出能力强,但输出账单也要重点监控 |
如果你做的是代码重构、复杂 Agent、长链路计划、多步骤分析或高价值业务决策,V4-Pro 更适合。如果只是高频轻量请求,全量使用 Pro 会抬高账单,并且并发上限低于 Flash。
DeepSeek 缓存命中怎么省钱:¥0.02 输入价适合哪些场景
DeepSeek API 的一个核心长尾关键词是“缓存命中”。套餐信息显示 Flash 缓存命中输入 ¥0.02/百万 tokens,Pro 缓存命中输入 ¥0.025/百万 tokens,远低于未命中输入价。
| 缓存场景 | 为什么适合缓存 | 成本影响 |
|---|---|---|
| 固定 system prompt | 每次请求都重复出现 | 命中后输入价可从 ¥1/¥3 降到 ¥0.02/¥0.025 |
| 长工具说明 | Agent 工具列表、函数说明、约束规则重复 | 减少长上下文重复计费 |
| 长对话前缀 | 多轮对话或项目背景反复携带 | 降低长期会话的输入成本 |
| 代码仓库背景 | README、架构说明、关键文件摘要重复使用 | 适合 Claude Code、Cursor、Cline 类开发工作流 |
| 批量同类任务 | 同一规则批量处理多条数据 | 固定 prompt 命中率越高,均摊成本越低 |
缓存不是自动解决所有成本问题。未命中的新增输入仍按正常输入价计费,输出仍按输出价计费。真正的优化是:固定内容缓存,动态内容精简,输出长度控制,失败重试记录。
DeepSeek 1M 上下文和 384K 输出有什么用:长文档和长代码库怎么估算成本
套餐信息显示 V4-Flash 和 V4-Pro 都支持 1M 上下文、最大 384K 输出。这个能力对长文档、长对话、代码仓库和 Agent 很有吸引力,但也容易让成本失控。
| 长上下文用途 | 适合怎么用 | 成本提醒 |
|---|---|---|
| 长文档问答 | 把文档摘要、章节结构和关键段落分层输入 | 不要每次塞完整文档,优先检索和摘要 |
| 代码库分析 | 先输入架构摘要、相关文件,再让模型定位问题 | 全仓库一次性输入会放大 tokens |
| Agent 多轮任务 | 保留任务状态、工具结果和关键决策 | 清理无用历史,避免上下文越滚越大 |
| 长输出报告 | 用于生成详细分析、迁移计划、评审报告 | 输出价按 ¥2/¥6 计费,长报告成本明显上升 |
| 批量处理 | 适合统一 prompt + 多条数据批量跑 | 要结合缓存和限流设计 |
1M 上下文的价值在于能处理复杂任务,不代表每次都应该用满。生产系统更建议把检索、摘要、缓存和模型路由组合起来。
DeepSeek 思考模式和非思考模式怎么选:deepseek-chat 和 reasoner 迁移要注意什么
套餐信息显示 V4 系列支持思考/非思考双模式,默认思考模式,可通过 API 参数切换非思考模式。旧模型名 deepseek-chat 和 deepseek-reasoner 将于北京时间 2026/07/24 23:59 弃用,并对应到 v4-flash 的非思考与思考模式。
| 模式 | 适合场景 | 注意事项 |
|---|---|---|
| 思考模式 | 复杂推理、规划、代码分析、长链路 Agent | 默认模式,更适合难任务,但要关注输出和延迟 |
| 非思考模式 | 快速问答、格式转换、轻量摘要、FIM 补全 | FIM 补全仅在非思考模式下可用 |
| deepseek-chat 迁移 | 对应 v4-flash 非思考模式 | 旧模型名会弃用,应提前改模型名和参数 |
| deepseek-reasoner 迁移 | 对应 v4-flash 思考模式 | 需要保留推理能力时不要直接切普通非思考请求 |
如果你在 Claude Code、Cursor 或 Cline 里用 DeepSeek,迁移时不要只改模型名,还要确认工具是否支持思考模式参数、FIM 补全和 Anthropic / OpenAI 格式。
DeepSeek 支持哪些工具接入:Claude Code、Cursor、Cline、Codex CLI 怎么配置思路
套餐信息显示 DeepSeek API 支持 OpenAI-compatible API、Anthropic-compatible API,并列出 Claude Code、Cursor、Cline、Codex CLI 等工具。工具接入的关键不是“能不能填 Key”,而是模型名、API 格式、模式和并发是否匹配。
| 工具/格式 | 资料依据 | 配置重点 |
|---|---|---|
| OpenAI-compatible API | supportedTools 记录 OpenAI-compatible API | 适合多数 SDK、网关、Cursor、Cline 和自建后端 |
| Anthropic-compatible API | supportedTools 记录 Anthropic-compatible API | 适合需要 Claude 风格接口的工具链 |
| Claude Code | 资料列为支持工具 | 关注 Anthropic 兼容格式、长上下文、工具调用和失败重试 |
| Cursor | 资料列为支持工具 | 关注模型名、base URL、并发和响应格式 |
| Cline / Codex CLI | 资料列为支持工具 | 关注 Tool Calls、JSON Output、非思考 FIM 和长任务成本 |
真实测试时建议用同一个仓库跑几类任务:解释代码、跨文件修改、修 bug、生成测试、总结变更。只测一次简单问答,看不出模型是否适合开发工作流。
DeepSeek 并发限制是多少:HTTP 429、账号粒度和生产系统怎么设计
套餐信息显示并发限制按账号粒度计算,与 API Key 无关:V4-Flash 并发 2500,V4-Pro 并发 500。一个请求从发出到模型响应完成记为一个并发,超出返回 HTTP 429。
| 并发项目 | V4-Flash | V4-Pro | 设计建议 |
|---|---|---|---|
| 账号并发上限 | 2500 | 500 | 高并发普通流量优先 Flash,Pro 做关键节点 |
| 计数方式 | 请求开始到响应完成 | 请求开始到响应完成 | 长输出会占用更久的并发槽 |
| 超限表现 | HTTP 429 | HTTP 429 | 需要队列、重试退避和模型降级 |
| API Key 关系 | 与单个 Key 无关 | 与单个 Key 无关 | 多 Key 不等于绕过账号并发上限 |
如果你做的是生产后端,不要等 429 出现才处理。应提前设置队列、超时、重试退避、Flash/Pro 分层和任务优先级。
DeepSeek API 怎么扣费:充值余额、赠送余额和免费额度怎么理解
套餐信息显示 DeepSeek 官方无包月 Coding Plan,费用 = token 消耗量 × 模型单价,从充值余额或赠送余额扣除;两者并存时优先扣赠送余额。资料页面未列明明确固定免费额度。
| 费用项目 | 资料 | 用户理解 |
|---|---|---|
| 计费方式 | API 按量计费 | 每次调用按输入、输出、缓存命中分别计算 |
| 扣费来源 | 充值余额或赠送余额 | 余额并存时优先扣赠送余额 |
| 免费额度 | 资料当前可核对的信息以按量计费为主,免费额度以页面更新为准 | 不应在文章里写固定免费额度 |
| 官方包月 | 官方无包月 Coding Plan | 固定月费需看第三方套餐,不是官方 DeepSeek API |
| 第三方套餐 | 火山方舟、天翼云、千帆等可能提供 DeepSeek | 走第三方套餐额度,不是 DeepSeek 官方余额 |
这部分很容易被误解。DeepSeek 官方 API 的成本估算应按真实调用量做,不应把第三方平台里的 DeepSeek 模型套餐当作官方包月。
DeepSeek-V4-Flash 和 V4-Pro 怎么选:高频任务、复杂推理和代码 Agent 分层
如果你搜索“DeepSeek-V4-Flash 和 V4-Pro 区别”,最实用的答案不是谁更好,而是怎么分层。
| 任务类型 | 推荐模型 | 原因 |
|---|---|---|
| 高频轻量问答、分类、摘要 | V4-Flash | 输入 ¥1、输出 ¥2,并发 2500,更适合大流量 |
| 日志分析、批量处理、自动化脚本 | V4-Flash | 成本低,并发高,可配合缓存 |
| 代码解释、简单修复、PR 总结 | V4-Flash 起步,必要时升 Pro | 普通任务先控成本,复杂任务再升级 |
| 复杂代码重构、架构分析 | V4-Pro | 更适合深度代码改造和长链路推理 |
| 关键业务决策、复杂 Agent | V4-Pro | 高价值任务更适合旗舰推理档 |
| 超长上下文任务 | 两者都可用 | 关键看质量要求、输出长度和预算 |
更稳的生产策略是:Flash 做默认层,Pro 做升级层。用失败率、用户等级、任务难度和输出长度决定是否升级,而不是把所有请求都打到 Pro。
DeepSeek API 成本怎么估算:上线前应该记录哪些指标
如果只是个人测试,直接看 V4-Flash 和 V4-Pro 单价就够;如果要上线产品,至少要记录 6 类数据:输入 tokens、输出 tokens、缓存命中率、模型路由比例、失败重试次数和 429 触发次数。
对于成本敏感产品,建议先用 Flash 承接大部分普通请求,再把 Pro 留给高价值或高难度任务。对于开发工具和 Agent,建议用真实代码库测试,不要只跑简单问答;长上下文、工具调用、失败重试和长输出,才是 DeepSeek API 账单的主要变量。
DeepSeek 价格和入口在哪里核对
DeepSeek API 价格、模型、入口和更新时间可以继续查看 TokenPlan 厂商详情页。可视化页面适合快速分享和横向比较。
可视化页面:https://tokenplan.pw/deepseek-token-api/
FAQ 常见问题
DeepSeek API 最便宜多少钱?
套餐信息显示 DeepSeek-V4-Flash 缓存未命中输入 ¥1、输出 ¥2/百万 tokens,缓存命中输入低至 ¥0.02/百万 tokens,是官方 V4 API 的低价高并发档。
DeepSeek-V4-Flash 和 V4-Pro 怎么选?
V4-Flash 适合高频批量、日常补全、成本敏感 Agent 和日志分析,并发上限 2500;V4-Pro 适合复杂推理、深度代码改造和长链路 Agent,并发上限 500。两者都支持 1M 上下文和最大 384K 输出。
DeepSeek API 有包月套餐吗?
套餐信息显示 DeepSeek 官方只有 API 按量计费,没有官方包月 Coding Plan。费用按 token 消耗量乘以模型单价,从充值余额或赠送余额扣除,余额并存时优先扣赠送余额。
DeepSeek 缓存命中价怎么计算?
V4-Flash 缓存命中输入为 ¥0.02/百万 tokens,V4-Pro 为 ¥0.025/百万 tokens;未命中部分仍按正常输入价计算。重复 system prompt、长对话前缀和固定工具说明适合设计上下文缓存。
DeepSeek 支持 Claude Code、Cursor 或 Cline 吗?
套餐信息显示 DeepSeek API 同时兼容 OpenAI 和 Anthropic API 格式,并列出 Claude Code、Cursor、Cline、Codex CLI 等工具。接入时要按对应 API 格式、模型名、思考模式和并发限制配置。