AI概念与词典

DeepSeek-R1 是什么?R1-Zero、训练流程、蒸馏模型与本地部署指南

DeepSeek-R1中文完整指南:分清R1、R1-Zero和六个Distill模型,理解冷启动、强化学习与监督微调流程,核对671B/37B/128K参数、许可证、本地部署和当前API边界。

DeepSeek-R1、R1-Zero 与六个 Qwen 和 Llama 蒸馏模型的训练关系及使用边界
本页目录
  1. DeepSeek-R1、R1-Zero 和 Distill 有什么区别?
  2. DeepSeek-R1 是怎样训练出来的?
  3. 阶段一:冷启动数据
  4. 阶段二:面向推理的强化学习
  5. 阶段三:拒绝采样与监督微调
  6. 阶段四:全场景强化学习
  7. 671B、37B 激活与 128K 上下文分别是什么意思?
  8. 六个 DeepSeek-R1-Distill 模型怎么选?
  9. 网页、当前 API、完整权重和蒸馏模型该选哪条路线?
  10. 本地部署前需要检查什么?
  11. DeepSeek-R1 可以商用吗?
  12. R1 的思维链等于可解释、可信答案吗?
  13. 常见问题
  14. DeepSeek-R1 现在还是 DeepSeek API 的模型名吗?
  15. R1-Distill-Qwen-32B 是 671B R1 的压缩版吗?
  16. 个人电脑一定能运行 1.5B 或 7B 吗?
  17. R1 输出了很长的推理过程,结果就更可靠吗?
  18. 官方资料与复核说明

直接回答:DeepSeek-R1 是深度求索在 2025 年公开的第一代推理模型家族,核心资产包括 DeepSeek-R1-Zero、正式版 DeepSeek-R1,以及基于 Qwen/Llama 基座训练的六个 Distill 模型。只有 R1-Zero 是在进入大规模强化学习前不使用监督微调(SFT)的研究路线;正式 R1 加入了冷启动数据和多阶段训练。它们是可以下载的开放权重,不等同于 DeepSeek 当前网页、App 或 V4 API 的全部能力。

本文面向想理解 R1 技术、选择开放权重或评估本地部署的中文用户。资料依据 DeepSeek 官方论文、仓库、模型卡与许可证整理,复核日期为 2026 年 7 月 17 日。如果你只是想找到当前官网、App 或 API,请先看DeepSeek 官网、模型与安全总指南;如果正在迁移线上接口,请直接查看DeepSeek V4 API 迁移指南

DeepSeek-R1、R1-Zero 与六个蒸馏模型之间的关系
R1 不是单个模型名:研究模型、正式模型和蒸馏模型的训练路径与使用门槛不同。图由兰塞 AI 编辑部依据官方模型卡绘制。

DeepSeek-R1、R1-Zero 和 Distill 有什么区别?

最常见的错误是把三个概念都叫作“纯强化学习模型”。根据DeepSeek-R1 官方仓库官方论文,R1-Zero 用 DeepSeek-V3-Base 直接进行大规模强化学习,用来验证推理行为能否在没有前置 SFT 的情况下出现;它同时出现重复、可读性差和语言混杂等问题。正式 R1 为解决这些问题加入冷启动数据,并继续经过推理强化学习、拒绝采样与 SFT、全场景强化学习。

名称 它是什么 关键训练差异 适合谁
DeepSeek-R1-Zero 研究型完整模型 进入大规模 RL 前没有 SFT;用于研究推理行为涌现 研究训练方法、复现实验的团队
DeepSeek-R1 面向使用的完整推理模型 冷启动 + 推理 RL + 拒绝采样/SFT + 全场景 RL 具备集群推理条件的研究与工程团队
R1-Distill 基于 Qwen/Llama 的六个稠密模型 使用 R1 生成的数据对上游基座微调;不是 671B 权重直接压缩 希望在较小硬件范围内实验的开发者

因此,“R1 完全不需要监督数据”只适用于 R1-Zero 的前置训练描述,不能套用到正式 R1。把 Distill 模型称为“满血 R1 的小参数版”也不准确:它们继承 Qwen 或 Llama 基座的结构和许可证条件,只是学习了 R1 生成的推理样本。

DeepSeek-R1 是怎样训练出来的?

论文的独特价值不是一句“用了强化学习”,而是把实验路线和面向使用的路线拆开。R1-Zero 先证明规则奖励与 GRPO 能推动模型形成更长的推理行为;正式 R1 再用四个阶段改善可读性、通用能力与人类偏好。把这一流程说成 AlphaGo 式“自我博弈”并不严谨:这里优化的是语言模型策略,奖励主要来自答案正确性、格式约束以及后续偏好对齐,并不存在两个对手轮流下棋。

DeepSeek-R1 从冷启动到两轮强化学习和监督微调的训练流程
正式 R1 的多阶段路线;R1-Zero 是旁路研究实验,不能与正式 R1 的完整训练流程混为一谈。

阶段一:冷启动数据

团队先收集少量具有清晰推理格式、可读性与人工友好表达的数据,对 DeepSeek-V3-Base 进行冷启动 SFT。这个阶段不是为了穷尽所有推理题,而是让后续探索从较可读、较一致的输出格式起步。

阶段二:面向推理的强化学习

模型在数学、代码和逻辑等结果较容易自动验证的任务上进行强化学习。官方论文使用 GRPO(Group Relative Policy Optimization),通过同一问题的一组回答计算相对优势,避免为每一步单独训练同等规模的 critic 模型。规则奖励关注答案正确性和格式;这不意味着中间每一句推理都被证明正确。

阶段三:拒绝采样与监督微调

团队从强化学习后的模型中采样推理数据,过滤无法验证或质量较差的输出,再与写作、事实问答、翻译、自我认知等非推理数据组合进行 SFT。这个阶段解释了为什么正式 R1 不只是数学解题器,也不能被概括成“完全没有标注数据”。

阶段四:全场景强化学习

最后一轮强化学习兼顾推理任务的规则奖励与通用任务的人类偏好,使帮助性、无害性和推理能力取得更可用的平衡。论文报告的是特定评测设置下的结果,不等于任何业务、任何提示词都能自动获得同样表现。

671B、37B 激活与 128K 上下文分别是什么意思?

官方模型卡列出完整 R1 与 R1-Zero 均为 671B 总参数、每个 token 约激活 37B 参数、上下文长度 128K。671B 描述模型包含的全部参数;37B 是混合专家架构在一次前向计算中被路由激活的参数规模。它并不意味着只需要按 37B 稠密模型准备存储、显存或内存。

字段 官方值 不能怎样理解
总参数 671B 不能写成 175B、660B 后再宣称是精确值
激活参数 37B 不代表完整权重只有 37B,也不直接等于显存需求
上下文 128K 不保证每项任务都能无损利用全部上下文
架构基础 DeepSeek-V3-Base Distill 模型并不采用同一 671B MoE 架构

实际资源需求还取决于权重精度、量化方式、KV cache、上下文长度、并发、推理框架与 GPU/CPU 卸载方案。没有这些条件,单独写“需要多少 GB 显存”会制造虚假的确定性。

六个 DeepSeek-R1-Distill 模型怎么选?

官方开放了 1.5B、7B、8B、14B、32B 和 70B 六个蒸馏 checkpoint。选择时先看基座与许可证,再看设备可承载的精度、上下文和速度;不要先看名称里的 R1 就假定它与完整模型能力相同。

模型 上游基座 官方许可证提示 选择提示
R1-Distill-Qwen-1.5B Qwen2.5-Math-1.5B Apache 2.0 上游条件 资源最紧、验证流程或教学实验
R1-Distill-Qwen-7B Qwen2.5-Math-7B Apache 2.0 上游条件 轻量实验与延迟优先
R1-Distill-Llama-8B Llama-3.1-8B-Base Llama 3.1 许可证 已有 Llama 工具链的团队
R1-Distill-Qwen-14B Qwen2.5-14B Apache 2.0 上游条件 质量与资源折中
R1-Distill-Qwen-32B Qwen2.5-32B Apache 2.0 上游条件 有较充足推理资源、重视推理质量
R1-Distill-Llama-70B Llama-3.3-70B-Instruct Llama 3.3 许可证 已有多卡或高内存部署能力

表中的“选择提示”是编辑部根据模型规模和上游生态给出的路线建议,不是官方性能承诺。部署前应在自己的输入长度、并发、量化和质量验收集上测试,而不是照搬网上的单一 tokens/s 或显存数字。

网页、当前 API、完整权重和蒸馏模型该选哪条路线?

按聊天、API、研究和本地部署需求选择 DeepSeek 使用路线
选择入口时先判断是否需要托管服务、可控版本或本地数据边界,再决定是否下载开放权重。
你的目标 建议入口 必须确认
临时问答,不管理基础设施 DeepSeek 官方网页/App 当前显示的模型、隐私政策与文件处理边界
把能力接入生产系统 当前 DeepSeek API 当前模型 ID、价格、上下文、停用公告与回滚
研究原始 R1 训练与行为 完整 R1/R1-Zero 开放权重 集群资源、推理框架、权重精度与安全隔离
在有限硬件上做本地实验 合适的 R1-Distill 模型 上游许可证、量化来源、上下文与质量损失

尤其要注意时间边界:2025 年公告中的 deepseek-reasoner 是当时的 R1 API 模型名;截至本文复核日,DeepSeek 官方 API 已采用 V4-Pro/Flash 体系,旧别名进入停用流程。不要从旧教程复制模型名直接上线,迁移步骤见V4 API 专题。需要用 DeepSeek 处理代码仓库时,还应参考DeepSeek 编程与代码验收指南,把模型输出当作候选补丁而不是可直接发布的结果。

本地部署前需要检查什么?

  1. 确认模型身份:核对 Hugging Face 仓库所有者、模型名、revision 与文件哈希;第三方 GGUF 或量化包不等于 DeepSeek 官方发布。
  2. 估算完整资源:同时计算权重、KV cache、上下文、并发和框架开销;先用目标输入做小规模基准。
  3. 遵循官方配置:官方仓库给 Distill 模型提供 vLLM 和 SGLang 示例,并建议温度 0.5–0.7、避免额外 system prompt。不同推理框架可能有自己的聊天模板,不要机械照搬。
  4. 建立输出验收:数学结果重新计算,代码运行测试与安全扫描,事实查询回到一手来源,高风险决定必须人工负责。
  5. 隔离数据与工具:本地权重不自动等于安全系统;仍需控制日志、缓存、上传文件、网络访问、插件权限和模型可执行动作。
  6. 保留回滚:记录权重版本、量化、提示模板、推理参数和评测集,升级前后用同一验收集比较。

DeepSeek-R1 可以商用吗?

官方仓库的代码与完整 R1 权重采用 MIT License,官方说明支持商业使用、修改与衍生工作。但 Distill 模型还继承各自上游基座条件:Qwen 系列对应 Apache 2.0,Llama 8B/70B 对应各自的 Llama 许可证。实际发布产品时应同时阅读目标 checkpoint 的模型卡、DeepSeek 许可证和上游许可证;“R1 允许商用”不能替代具体模型的合规审核。

R1 的思维链等于可解释、可信答案吗?

不等于。模型展示的推理文字是生成内容,可能遗漏关键前提、在中间步骤犯错,甚至用看似连贯的解释包装错误结论。它可以帮助用户发现假设和检查路径,但不能证明模型内部因果机制,也不能替代可执行测试、外部证据或专业审核。

  • 数学:复算结果并检查边界条件。
  • 代码:运行单元测试、静态分析、依赖和密钥扫描。
  • 事实:要求可访问的一手来源并逐条核对。
  • 医疗、法律、金融:只作信息整理,不能让模型独立作出高风险决定。
  • 智能体:限制工具权限、支出、数据范围和可逆操作。

常见问题

DeepSeek-R1 现在还是 DeepSeek API 的模型名吗?

不能这样假定。R1 开放权重仍可下载研究,但官方托管 API 的当前模型体系会更新。调用前应以 API 文档当前列出的模型 ID 为准,而不是以 2025 年教程中的 deepseek-reasoner 为准。

R1-Distill-Qwen-32B 是 671B R1 的压缩版吗?

更准确地说,它是以 Qwen2.5-32B 为基座、使用 R1 生成样本进行微调的稠密模型。它学习了部分推理模式,但架构、参数规模和能力边界都不同于完整 R1。

个人电脑一定能运行 1.5B 或 7B 吗?

不能只看参数量下结论。是否可运行取决于权重格式、量化、内存/显存、上下文长度、推理框架和系统可用资源。先下载可信来源的小模型,在短上下文和低并发下测试,再逐步扩大。

R1 输出了很长的推理过程,结果就更可靠吗?

不一定。输出长度不是正确性指标。真正的验收应针对最终任务:可计算的重新计算、可执行的运行测试、有来源的逐条核对,以及高风险场景的人工审批。

官方资料与复核说明

编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 17 日重写。旧稿把正式 R1 简化成纯强化学习,把训练描述成自我博弈,并混入无法由来源支持的机理、性能和应用断言;本次依据官方论文与模型卡重建 R1-Zero、正式 R1、Distill、当前 API 和许可证的边界。本站的来源、更新与纠错原则见关于本站与编辑规范