截至 2026 年 7 月 15 日的更新结论:DeepSeek 官方 API 文档仍将当前版本称为 DeepSeek V4 Preview,API 提供 deepseek-v4-pro 与 deepseek-v4-flash。原有的 deepseek-chat、deepseek-reasoner 将在 2026 年 7 月 24 日 15:59(UTC),即北京时间 7 月 24 日 23:59 后停止访问。正在使用 DeepSeek API 的项目,应立即完成模型名替换、回归测试和灰度切换。
信息边界:本文只把 DeepSeek 官网与官方 API 文档作为模型名、价格、接口和停用时间的事实来源。关于“正式版上线时间”或后续峰谷定价的媒体消息,在官方文档更新前不写成已经生效的配置。
DeepSeek V4 到底更新了什么?
根据 DeepSeek 官方发布说明,V4 Preview 分为两个 API 模型:V4-Pro 面向复杂推理与智能体编码任务,V4-Flash 更侧重速度、效率和成本。两者均支持 1M 上下文、思考与非思考模式,并兼容 OpenAI ChatCompletions 接口和 Anthropic 接口。
| 项目 | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| API 模型名 | deepseek-v4-pro |
deepseek-v4-flash |
| 官方定位 | 复杂推理、编码与智能体任务 | 更快、更经济的通用选择 |
| 上下文 | 1M | 1M |
| 最大输出 | 384K | 384K |
| 接口 | OpenAI ChatCompletions 与 Anthropic API | |
| 思考模式 | 均支持思考与非思考模式 | |
| 缓存命中输入价 | 0.025 元 / 百万 Tokens | 0.02 元 / 百万 Tokens |
| 缓存未命中输入价 | 3 元 / 百万 Tokens | 1 元 / 百万 Tokens |
| 输出价 | 6 元 / 百万 Tokens | 2 元 / 百万 Tokens |
| 账号并发限制 | 500 | 2500 |
价格与并发数据复核于 2026 年 7 月 15 日,均来自 DeepSeek 官方“模型与价格”和“限速与隔离”页面;价格可能调整,预算评估时应再次查看官方页面。
需要特别纠正的是:本站旧版文章曾将 V4 描述为“256K 上下文”和“原生多模态”,还引用了未经官方材料支持的性能数字。现已全部删除。本文只保留能够从 DeepSeek 官方文档核验的信息。
旧模型名什么时候停用?
DeepSeek 官方说明显示,deepseek-chat 和 deepseek-reasoner 在过渡期分别路由到 V4-Flash 的非思考与思考模式;两者将在北京时间 2026 年 7 月 24 日 23:59 后完全停用并无法访问。
不要把“现在还能调用”误认为“无需迁移”。如果模型名写在环境变量、数据库、低代码平台、定时任务或第三方 SDK 配置中,停用后都可能直接报错。应先搜索完整代码仓库和生产配置,再确定影响范围。
V4-Pro 和 V4-Flash 怎么选?
- 优先选择 V4-Flash:客服问答、信息抽取、分类、摘要、常规内容生成,以及对延迟和成本敏感的高并发任务。
- 优先选择 V4-Pro:复杂代码修改、长链路智能体、数学与 STEM 推理,以及错误成本较高的复杂任务。
- 采用双模型路由:先用 Flash 处理常规请求,遇到复杂度阈值、低置信度或失败重试时再升级到 Pro。
最终选择不应只看模型宣传或单一榜单。建议用自己的真实请求建立测试集,至少比较任务成功率、结构化输出通过率、P95 延迟、平均 Token 消耗和人工复核通过率。
迁移前先完成这 5 项盘点
- 搜索旧模型名:检查源码、环境变量、容器配置、CI/CD、数据库、工作流平台和监控告警。
- 保存基线:从生产日志抽取经过脱敏的真实请求,记录当前输出质量、延迟、Token 与错误率。
- 确认功能依赖:重点检查工具调用、JSON 输出、多轮会话、思考模式、上下文缓存和流式输出。
- 设置可切换配置:不要把新模型名散落硬编码,应集中到环境变量或配置中心。
- 准备回滚路径:保留上一个稳定配置和发布版本,但不要把即将停用的旧模型名当作长期回滚方案。
Python 迁移示例
DeepSeek 的 base_url 保持不变,核心改动是把 model 参数改为新的明确模型名。下面示例使用 OpenAI 兼容客户端:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model=os.getenv("DEEPSEEK_MODEL", "deepseek-v4-flash"),
messages=[
{"role": "system", "content": "请给出可核验、简洁的回答。"},
{"role": "user", "content": "用三点说明上线前如何做 API 回归测试。"},
],
stream=False,
)
print(response.choices[0].message.content)
生产环境建议通过 DEEPSEEK_MODEL 切换模型,而不是每次修改代码。这样可以先让少量流量进入 V4-Flash 或 V4-Pro,再按指标逐步扩大。
思考模式迁移时必须检查什么?
V4-Pro 与 V4-Flash 均支持思考和非思考模式,默认开启思考。使用 OpenAI SDK 时,开关要通过 extra_body={"thinking": {"type": "enabled"}} 传入,思考强度使用 reasoning_effort="high" 或 "max"。
思考模式下,temperature、top_p、presence_penalty 与 frequency_penalty 不生效。更容易被忽略的是工具调用:如果一次思考过程中发生了 Tool Calls,后续请求必须完整回传该轮的 reasoning_content,否则官方文档说明会返回 400 错误。原先只保存 content 的会话代码,需要把这一项纳入回归测试。
cURL 最小调用示例
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "user", "content": "返回一个包含 status 和 summary 的 JSON 对象"}
],
"stream": false
}'
密钥必须放在服务端环境变量或密钥管理服务中,不要写进前端代码、公开仓库、截图或日志。
从旧模型名迁移时容易踩的 6 个坑
- 只改主服务:定时任务、备用服务和低代码工作流仍使用旧模型名。
- 把 1M 当作推荐输入长度:更长上下文仍会增加延迟和成本,应先做检索、去重和分段。
- 只看单次输出:必须用固定测试集多次运行,观察稳定性和结构化输出成功率。
- 忽略工具调用差异:参数校验、工具选择与重试策略都应重新测试。
- 没有灰度开关:新旧配置无法快速切换,出现异常时只能紧急发版。
- 日志泄露敏感内容:测试数据应脱敏,日志避免记录完整提示词、密钥和个人信息。
一份可直接执行的上线检查清单
- 代码库与配置中心已不存在计划继续运行的旧模型名。
- 核心业务测试集已覆盖正常、边界、拒答、超长输入和工具调用场景。
- V4-Flash 与 V4-Pro 的质量、延迟、Token 和错误率已有对照数据。
- 模型名可通过配置切换,灰度比例可控。
- 超时、限流、重试和熔断策略已验证。
- 监控能够按模型版本区分请求量、成功率与 P95 延迟。
- 上线负责人、观察窗口与回滚条件已明确。
常见问题
base_url 需要修改吗?
不需要。DeepSeek 官方说明为保持原有 base_url,将模型名改成 deepseek-v4-pro 或 deepseek-v4-flash。
deepseek-chat 和 deepseek-reasoner 现在还能用吗?
在过渡期内仍可访问,当前分别路由到 V4-Flash 的非思考与思考模式;但官方明确说明它们将在 2026 年 7 月 24 日 15:59(UTC)后停止访问,不应继续用于新项目。
V4-Pro 一定比 V4-Flash 更适合所有任务吗?
不是。复杂任务可优先测试 Pro,常规和高并发任务可优先测试 Flash。正确做法是用真实业务测试集比较,而不是仅凭模型大小选择。
1M 上下文是否意味着可以直接塞入整个知识库?
不建议。上下文容量是上限能力,不代表每次都应使用最大长度。检索、去重、权限过滤与引用定位仍然重要。
官方来源与延伸阅读
- DeepSeek V4 Preview Release(官方)
- DeepSeek API Change Log(官方)
- DeepSeek Thinking Mode(官方)
- DeepSeek 模型与价格(官方)
- DeepSeek 限速与隔离(官方)
- DeepSeek 使用全攻略:面向普通用户的入门指南
- AI 教程栏目:更多 API 与工具实战
本文由 AI问答站编辑部于 2026 年 7 月 15 日依据 DeepSeek 官方文档复核。模型名称、接口与停用时间可能继续变化,生产部署前请再次查看官方更新日志。