直接回答:DeepSeek-R1 是深度求索在 2025 年公开的第一代推理模型家族,核心资产包括 DeepSeek-R1-Zero、正式版 DeepSeek-R1,以及基于 Qwen/Llama 基座训练的六个 Distill 模型。只有 R1-Zero 是在进入大规模强化学习前不使用监督微调(SFT)的研究路线;正式 R1 加入了冷启动数据和多阶段训练。它们是可以下载的开放权重,不等同于 DeepSeek 当前网页、App 或 V4 API 的全部能力。
本文面向想理解 R1 技术、选择开放权重或评估本地部署的中文用户。资料依据 DeepSeek 官方论文、仓库、模型卡与许可证整理,复核日期为 2026 年 7 月 17 日。如果你只是想找到当前官网、App 或 API,请先看DeepSeek 官网、模型与安全总指南;如果正在迁移线上接口,请直接查看DeepSeek V4 API 迁移指南。

DeepSeek-R1、R1-Zero 和 Distill 有什么区别?
最常见的错误是把三个概念都叫作“纯强化学习模型”。根据DeepSeek-R1 官方仓库与官方论文,R1-Zero 用 DeepSeek-V3-Base 直接进行大规模强化学习,用来验证推理行为能否在没有前置 SFT 的情况下出现;它同时出现重复、可读性差和语言混杂等问题。正式 R1 为解决这些问题加入冷启动数据,并继续经过推理强化学习、拒绝采样与 SFT、全场景强化学习。
| 名称 | 它是什么 | 关键训练差异 | 适合谁 |
|---|---|---|---|
| DeepSeek-R1-Zero | 研究型完整模型 | 进入大规模 RL 前没有 SFT;用于研究推理行为涌现 | 研究训练方法、复现实验的团队 |
| DeepSeek-R1 | 面向使用的完整推理模型 | 冷启动 + 推理 RL + 拒绝采样/SFT + 全场景 RL | 具备集群推理条件的研究与工程团队 |
| R1-Distill | 基于 Qwen/Llama 的六个稠密模型 | 使用 R1 生成的数据对上游基座微调;不是 671B 权重直接压缩 | 希望在较小硬件范围内实验的开发者 |
因此,“R1 完全不需要监督数据”只适用于 R1-Zero 的前置训练描述,不能套用到正式 R1。把 Distill 模型称为“满血 R1 的小参数版”也不准确:它们继承 Qwen 或 Llama 基座的结构和许可证条件,只是学习了 R1 生成的推理样本。
DeepSeek-R1 是怎样训练出来的?
论文的独特价值不是一句“用了强化学习”,而是把实验路线和面向使用的路线拆开。R1-Zero 先证明规则奖励与 GRPO 能推动模型形成更长的推理行为;正式 R1 再用四个阶段改善可读性、通用能力与人类偏好。把这一流程说成 AlphaGo 式“自我博弈”并不严谨:这里优化的是语言模型策略,奖励主要来自答案正确性、格式约束以及后续偏好对齐,并不存在两个对手轮流下棋。
阶段一:冷启动数据
团队先收集少量具有清晰推理格式、可读性与人工友好表达的数据,对 DeepSeek-V3-Base 进行冷启动 SFT。这个阶段不是为了穷尽所有推理题,而是让后续探索从较可读、较一致的输出格式起步。
阶段二:面向推理的强化学习
模型在数学、代码和逻辑等结果较容易自动验证的任务上进行强化学习。官方论文使用 GRPO(Group Relative Policy Optimization),通过同一问题的一组回答计算相对优势,避免为每一步单独训练同等规模的 critic 模型。规则奖励关注答案正确性和格式;这不意味着中间每一句推理都被证明正确。
阶段三:拒绝采样与监督微调
团队从强化学习后的模型中采样推理数据,过滤无法验证或质量较差的输出,再与写作、事实问答、翻译、自我认知等非推理数据组合进行 SFT。这个阶段解释了为什么正式 R1 不只是数学解题器,也不能被概括成“完全没有标注数据”。
阶段四:全场景强化学习
最后一轮强化学习兼顾推理任务的规则奖励与通用任务的人类偏好,使帮助性、无害性和推理能力取得更可用的平衡。论文报告的是特定评测设置下的结果,不等于任何业务、任何提示词都能自动获得同样表现。
671B、37B 激活与 128K 上下文分别是什么意思?
官方模型卡列出完整 R1 与 R1-Zero 均为 671B 总参数、每个 token 约激活 37B 参数、上下文长度 128K。671B 描述模型包含的全部参数;37B 是混合专家架构在一次前向计算中被路由激活的参数规模。它并不意味着只需要按 37B 稠密模型准备存储、显存或内存。
| 字段 | 官方值 | 不能怎样理解 |
|---|---|---|
| 总参数 | 671B | 不能写成 175B、660B 后再宣称是精确值 |
| 激活参数 | 37B | 不代表完整权重只有 37B,也不直接等于显存需求 |
| 上下文 | 128K | 不保证每项任务都能无损利用全部上下文 |
| 架构基础 | DeepSeek-V3-Base | Distill 模型并不采用同一 671B MoE 架构 |
实际资源需求还取决于权重精度、量化方式、KV cache、上下文长度、并发、推理框架与 GPU/CPU 卸载方案。没有这些条件,单独写“需要多少 GB 显存”会制造虚假的确定性。
六个 DeepSeek-R1-Distill 模型怎么选?
官方开放了 1.5B、7B、8B、14B、32B 和 70B 六个蒸馏 checkpoint。选择时先看基座与许可证,再看设备可承载的精度、上下文和速度;不要先看名称里的 R1 就假定它与完整模型能力相同。
| 模型 | 上游基座 | 官方许可证提示 | 选择提示 |
|---|---|---|---|
| R1-Distill-Qwen-1.5B | Qwen2.5-Math-1.5B | Apache 2.0 上游条件 | 资源最紧、验证流程或教学实验 |
| R1-Distill-Qwen-7B | Qwen2.5-Math-7B | Apache 2.0 上游条件 | 轻量实验与延迟优先 |
| R1-Distill-Llama-8B | Llama-3.1-8B-Base | Llama 3.1 许可证 | 已有 Llama 工具链的团队 |
| R1-Distill-Qwen-14B | Qwen2.5-14B | Apache 2.0 上游条件 | 质量与资源折中 |
| R1-Distill-Qwen-32B | Qwen2.5-32B | Apache 2.0 上游条件 | 有较充足推理资源、重视推理质量 |
| R1-Distill-Llama-70B | Llama-3.3-70B-Instruct | Llama 3.3 许可证 | 已有多卡或高内存部署能力 |
表中的“选择提示”是编辑部根据模型规模和上游生态给出的路线建议,不是官方性能承诺。部署前应在自己的输入长度、并发、量化和质量验收集上测试,而不是照搬网上的单一 tokens/s 或显存数字。
网页、当前 API、完整权重和蒸馏模型该选哪条路线?
| 你的目标 | 建议入口 | 必须确认 |
|---|---|---|
| 临时问答,不管理基础设施 | DeepSeek 官方网页/App | 当前显示的模型、隐私政策与文件处理边界 |
| 把能力接入生产系统 | 当前 DeepSeek API | 当前模型 ID、价格、上下文、停用公告与回滚 |
| 研究原始 R1 训练与行为 | 完整 R1/R1-Zero 开放权重 | 集群资源、推理框架、权重精度与安全隔离 |
| 在有限硬件上做本地实验 | 合适的 R1-Distill 模型 | 上游许可证、量化来源、上下文与质量损失 |
尤其要注意时间边界:2025 年公告中的 deepseek-reasoner 是当时的 R1 API 模型名;截至本文复核日,DeepSeek 官方 API 已采用 V4-Pro/Flash 体系,旧别名进入停用流程。不要从旧教程复制模型名直接上线,迁移步骤见V4 API 专题。需要用 DeepSeek 处理代码仓库时,还应参考DeepSeek 编程与代码验收指南,把模型输出当作候选补丁而不是可直接发布的结果。
本地部署前需要检查什么?
- 确认模型身份:核对 Hugging Face 仓库所有者、模型名、revision 与文件哈希;第三方 GGUF 或量化包不等于 DeepSeek 官方发布。
- 估算完整资源:同时计算权重、KV cache、上下文、并发和框架开销;先用目标输入做小规模基准。
- 遵循官方配置:官方仓库给 Distill 模型提供 vLLM 和 SGLang 示例,并建议温度 0.5–0.7、避免额外 system prompt。不同推理框架可能有自己的聊天模板,不要机械照搬。
- 建立输出验收:数学结果重新计算,代码运行测试与安全扫描,事实查询回到一手来源,高风险决定必须人工负责。
- 隔离数据与工具:本地权重不自动等于安全系统;仍需控制日志、缓存、上传文件、网络访问、插件权限和模型可执行动作。
- 保留回滚:记录权重版本、量化、提示模板、推理参数和评测集,升级前后用同一验收集比较。
DeepSeek-R1 可以商用吗?
官方仓库的代码与完整 R1 权重采用 MIT License,官方说明支持商业使用、修改与衍生工作。但 Distill 模型还继承各自上游基座条件:Qwen 系列对应 Apache 2.0,Llama 8B/70B 对应各自的 Llama 许可证。实际发布产品时应同时阅读目标 checkpoint 的模型卡、DeepSeek 许可证和上游许可证;“R1 允许商用”不能替代具体模型的合规审核。
R1 的思维链等于可解释、可信答案吗?
不等于。模型展示的推理文字是生成内容,可能遗漏关键前提、在中间步骤犯错,甚至用看似连贯的解释包装错误结论。它可以帮助用户发现假设和检查路径,但不能证明模型内部因果机制,也不能替代可执行测试、外部证据或专业审核。
- 数学:复算结果并检查边界条件。
- 代码:运行单元测试、静态分析、依赖和密钥扫描。
- 事实:要求可访问的一手来源并逐条核对。
- 医疗、法律、金融:只作信息整理,不能让模型独立作出高风险决定。
- 智能体:限制工具权限、支出、数据范围和可逆操作。
常见问题
DeepSeek-R1 现在还是 DeepSeek API 的模型名吗?
不能这样假定。R1 开放权重仍可下载研究,但官方托管 API 的当前模型体系会更新。调用前应以 API 文档当前列出的模型 ID 为准,而不是以 2025 年教程中的 deepseek-reasoner 为准。
R1-Distill-Qwen-32B 是 671B R1 的压缩版吗?
更准确地说,它是以 Qwen2.5-32B 为基座、使用 R1 生成样本进行微调的稠密模型。它学习了部分推理模式,但架构、参数规模和能力边界都不同于完整 R1。
个人电脑一定能运行 1.5B 或 7B 吗?
不能只看参数量下结论。是否可运行取决于权重格式、量化、内存/显存、上下文长度、推理框架和系统可用资源。先下载可信来源的小模型,在短上下文和低并发下测试,再逐步扩大。
R1 输出了很长的推理过程,结果就更可靠吗?
不一定。输出长度不是正确性指标。真正的验收应针对最终任务:可计算的重新计算、可执行的运行测试、有来源的逐条核对,以及高风险场景的人工审批。
官方资料与复核说明
- DeepSeek-R1 官方论文
- DeepSeek-R1 官方 GitHub 仓库
- DeepSeek-R1 官方 Hugging Face 模型卡
- DeepSeek-R1 发布公告
- DeepSeek 当前 API 文档
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 17 日重写。旧稿把正式 R1 简化成纯强化学习,把训练描述成自我博弈,并混入无法由来源支持的机理、性能和应用断言;本次依据官方论文与模型卡重建 R1-Zero、正式 R1、Distill、当前 API 和许可证的边界。本站的来源、更新与纠错原则见关于本站与编辑规范。
