AI教程

Windows 本地部署 DeepSeek‑R1 与知识库:Ollama + Open WebUI 教程

Windows本地运行DeepSeek‑R1并搭建知识库的完整教程:按资源选择Ollama模型,连接OpenWebUI,验证RAG引用,并处理离线、安全与常见故障。

Windows从安装Ollama、运行DeepSeek-R1到连接Open WebUI和建立本地知识库的五步链路
本页目录
  1. 开始前:本地部署能解决什么,不能保证什么?
  2. 第一步:根据电脑资源选择 DeepSeek‑R1 模型
  3. 第二步:在 Windows 安装并验证 Ollama
  4. 下载并运行模型
  5. 第三步:安装 Open WebUI 并连接宿主机 Ollama
  6. 第四步:建立知识库,而不是“训练专属模型”
  7. 用一组可复核问题验收
  8. 第五步:把“完全离线”和安全边界说清楚
  9. 如何判断本机资源够不够?
  10. 更新、备份和回滚怎么做?
  11. 常见故障速查
  12. 官方资料与编辑复核

直接回答:Windows 10/11 用户可以先安装 Ollama,用 ollama run deepseek-r1:8b 下载并运行当前 8B 蒸馏模型,再通过 Docker 启动 Open WebUI,把它连接到宿主机的 http://host.docker.internal:11434。上传文档后应验证检索片段和引用,而不是把“能回答”误认为“已经训练了专属模型”。

本文按 2026 年 7 月 17 日的 Ollama 模型库、DeepSeek‑R1 官方仓库和 Open WebUI 文档复核。模型标签、镜像版本和菜单会更新,执行前请同时打开文中的官方链接确认。只想了解 R1、R1‑Zero 与蒸馏模型的原理,可先看DeepSeek‑R1 原理与部署指南

Windows从安装Ollama、运行DeepSeek-R1到连接Open WebUI和建立本地知识库的五步链路
本地知识库由推理模型、文档抽取、检索和界面共同组成;文档检索不是重新训练模型。图由兰塞 AI 编辑部原创。

开始前:本地部署能解决什么,不能保证什么?

本地运行的主要价值是锁定模型版本、减少每次问答对外部 API 的依赖,并让文档和聊天数据保留在自己控制的设备与容器中。但“本地”不是绝对安全,也不一定更快:恶意软件、共享 Windows 账户、浏览器扩展、云盘同步、未加密磁盘、开放的 11434/3000 端口和错误的容器配置仍可能泄露数据。

常见说法 更准确的判断 你要验证什么
本地部署绝不泄露 减少外部传输,但风险转移到本机、账户和网络 磁盘加密、账户权限、端口、防火墙、备份与同步
本地一定更快 速度由 CPU/GPU、内存、模型大小和上下文决定 首 token 时间、生成速度、内存峰值和温度
上传文档就是训练 Open WebUI Knowledge 通常使用 RAG 检索相关片段 抽取文本、检索命中、引用和无答案拒答
8B 就是完整 R1 Ollama 默认 8B 是蒸馏模型,不是 671B 完整权重 标签、模型卡、基础模型与许可证

第一步:根据电脑资源选择 DeepSeek‑R1 模型

不要先下载最大模型。Ollama 当前 DeepSeek‑R1 模型库列出多个尺寸,其中默认 deepseek-r1deepseek-r1:8b 对应 R1‑0528‑Qwen3‑8B,下载体积约 5.2GB;7B 约 4.7GB、14B 约 9.0GB、32B 约 20GB。下载体积不是最低运行内存:上下文、KV Cache、并发和 GPU/CPU 分配还会增加占用。

Ollama中DeepSeek-R1的1.5B、7B、8B、14B和32B模型体积与适用资源选择
保守做法是从 1.5B、7B 或 8B 验证流程,再根据质量和速度升级;图中体积来自 Ollama 模型库,实际资源需本机测量。
标签 模型库体积 适合起步场景 注意
deepseek-r1:1.5b 约 1.1GB 低资源试跑、验证安装链路 复杂推理和知识库综合能力有限
deepseek-r1:7b 约 4.7GB 普通问答、轻量文档检索 Qwen 蒸馏版,先用短上下文
deepseek-r1:8b 约 5.2GB 当前较均衡的默认起点 R1‑0528‑Qwen3‑8B,旧教程可能指向 Llama 8B
deepseek-r1:14b 约 9.0GB 更高质量、较强工作站 需要更多 RAM/VRAM,CPU 生成可能较慢
deepseek-r1:32b 约 20GB 高资源工作站、复杂任务 不适合作为普通电脑的首次下载

DeepSeek 官方R1 仓库说明,1.5B/7B/14B/32B 源自 Qwen 2.5 系列蒸馏,8B 和 70B 另有 Llama 衍生关系;当前 Ollama 8B 标签已更新为 Qwen3 版本,因此写教程必须同时注明“标签”和复核日期。查看当前 DeepSeek 官网、API 和开放权重关系,可参考DeepSeek 完整入口与选型指南

第二步:在 Windows 安装并验证 Ollama

Ollama 官方Windows 下载页要求 Windows 10 或更高版本。对新手更稳妥的做法是从官方页面下载安装包并确认域名,而不是从第三方下载站获取。安装完成后打开新的 PowerShell 窗口:

ollama --version
ollama list
Invoke-RestMethod http://localhost:11434/api/tags

第一条确认命令可用,第二条列出已下载模型,第三条确认本机 Ollama API 正在监听。Ollama Windows 服务通常在后台提供 localhost:11434;不要为了连接本机界面就把它暴露到公网。

下载并运行模型

ollama run deepseek-r1:8b

首次运行会下载数 GB 权重,时间取决于网络和磁盘。进入对话后先做两类检查:一类是简单事实和中文指令,确认模型正常输出;另一类是你真实任务的短样本,记录速度和内存。结束交互可输入 /bye。以后更新同一标签可使用:

ollama pull deepseek-r1:8b

更新会改变实际权重,生产或长期研究环境应记录 ollama list、标签和更新时间;不要在没有回归测试时静默更新。Ollama 当前模型页面还提供 1.5B、7B、14B、32B、70B 与 671B 等标签,但 671B 权重体积约 404GB,远超普通 Windows 电脑的合理起步范围。

第三步:安装 Open WebUI 并连接宿主机 Ollama

Open WebUI 官方把 Docker 列为推荐安装路径。先安装并启动 Docker Desktop,然后在 PowerShell 执行下面的命令。它把网页映射到本机 3000 端口,把数据保存在 Docker volume,并通过 Windows/Docker 的宿主地址连接 Ollama:

docker run -d `
  -p 3000:8080 `
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 `
  -v open-webui:/app/backend/data `
  --name open-webui `
  --restart always `
  ghcr.io/open-webui/open-webui:main

命令依据 Open WebUI Quick StartOllama 连接文档整理。打开 http://localhost:3000 后创建本地管理员账户。若界面没有模型,先检查:

  1. 宿主 PowerShell 中 Invoke-RestMethod http://localhost:11434/api/tags 是否返回模型。
  2. docker ps 是否显示 Open WebUI 容器正在运行。
  3. docker logs open-webui --tail 100 是否出现连接错误。
  4. Open WebUI 的 Ollama URL 是否为 http://host.docker.internal:11434,不是容器内的 localhost
  5. Windows 防火墙或安全软件是否阻止 Docker 访问宿主服务。

版本提醒:main 会随项目更新。个人试用方便,但正式环境应阅读官方版本说明、固定经过验证的镜像标签并备份 volume,不能把“自动更新”当作无风险操作。

第四步:建立知识库,而不是“训练专属模型”

在 Open WebUI 的 Workspace/Knowledge 中创建知识集合并上传已获授权的 PDF、Office、文本或代码文件。官方 Knowledge 文档把它描述为检索增强:系统抽取和索引文档,提问时寻找相关片段,再把片段交给模型回答。权重通常没有发生训练或微调。

阶段 要检查的证据 常见失败
文档抽取 页码、标题、表格、OCR 文本可读 扫描 PDF 没有 OCR、乱码、表格错列
切分与索引 片段保留来源、章节和更新时间 切得太碎丢上下文,太长又检索不准
检索 真实问题能召回正确原文 关键词变体、简称或跨章节问题未命中
回答 结论能逐句回到文档证据 模型把常识、旧知识和文档混在一起
拒答 文档没有答案时明确说不知道 为了“有帮助”而编造不存在的条款
本地知识库从文档抽取、切分索引、检索、回答、引用核对到反例回归的六步验证闭环
知识库质量要用“正确命中、正确引用、无答案拒答”共同验收,不能只看一次演示是否流畅。图由兰塞 AI 编辑部原创。

用一组可复核问题验收

  • 直接问题:答案明确写在某一页,检查是否引用正确片段。
  • 改写问题:不用文档原词提问,检查语义检索是否仍能命中。
  • 跨段问题:答案需要两处证据,检查是否遗漏限制条件。
  • 版本问题:上传新旧两版制度,检查回答是否说明日期和冲突。
  • 无答案问题:故意询问文档不存在的数字,模型应拒答或提示缺证据。
  • 恶意文档:文档中的“忽略系统规则”等文本不应改变应用权限。

若答案错,先看检索片段是否正确:片段就错,调整抽取、OCR、切分、嵌入和检索;片段正确但回答错,再调整提示、模型和上下文。不要只换更大模型掩盖索引问题。

第五步:把“完全离线”和安全边界说清楚

完成模型、嵌入模型和容器镜像下载后,Ollama 推理可以不依赖外部 API。但 Open WebUI 可能配置网页搜索、外部模型、更新检查或其他连接;Windows 也可能运行 OneDrive、第三方同步、远程管理和安全软件。因此“完全离线”应通过网络观察和配置证明,而不是根据产品名称推断。

  • 只把 11434 和 3000 绑定在可信本机/局域网范围,不直接暴露公网。
  • 为 Windows、Open WebUI 和共享文件分别设置账户与最小权限。
  • 敏感文档进入知识库前确认授权、保留期限、删除和备份策略。
  • 关闭不需要的网页搜索、外部 API、遥测或插件,并检查实际网络连接。
  • 对 Docker volume、Ollama 模型目录和原始文档做加密备份;定期验证恢复。
  • 多人使用时不要共用管理员账号;删除知识库时同时核对索引、原文件和备份。

企业或多人环境还应加入审计、漏洞修复、数据分级和事件响应,详见DeepSeek 企业落地与安全治理指南。若要让模型调用文件、数据库或脚本,则需进一步实施AI 智能体权限与审批边界

如何判断本机资源够不够?

与其照抄“16GB 内存可运行”一类结论,不如用同一组任务做一次本机容量测试。先关闭不必要的大型应用,在 Windows 任务管理器的“性能”页观察内存、专用 GPU 内存、共享 GPU 内存和磁盘;再从短上下文开始,让模型分别完成一次问答、长回答和知识库检索。测试过程中不要同时下载模型,否则磁盘和网络会干扰结果。

记录项 为什么重要 可接受条件由谁决定
模型标签与更新时间 同一标签更新后能力和资源可能变化 项目负责人固定版本基线
首 token 等待时间 决定交互是否让用户误以为卡死 按真实工作节奏设上限
持续生成速度 决定长回答和批量任务耗时 与更小模型或在线方案比较
RAM/VRAM 峰值 接近满载会触发换页、卡顿或失败 为系统和并发保留余量
答案与引用正确性 快但错误的模型不适合知识库 用固定验收集人工复核
温度、噪声和稳定性 持续高负载不同于一次演示 按设备散热与使用时长判断

如果 8B 已经频繁占满内存或等待过长,优先缩短上下文、关闭并发或退到 7B/1.5B;如果速度可接受但答案不足,再考虑 14B。不要只因磁盘还能容纳 32B 就认为它适合持续运行。

更新、备份和回滚怎么做?

Ollama 模型、Open WebUI 容器和知识库数据是三套不同资产。更新前分别记录状态,不能只备份原始 PDF:

ollama list
docker inspect open-webui
docker volume inspect open-webui
docker logs open-webui --tail 100
  • 模型:记录标签、更新时间和固定验收集;ollama pull 后先回归,再替换日常使用版本。
  • 界面:生产使用应固定经过验证的 Open WebUI 镜像标签。升级前查看发行说明并保留旧镜像,失败时可按旧配置重新创建容器。
  • 数据:定期备份 Docker volume,并验证能够恢复用户、聊天、连接和知识库;备份文件本身也需要加密和访问控制。
  • 文档:保存原始文件、版本日期和授权记录。知识库索引可以重建,但缺失的原文和版本关系无法靠向量库恢复。
  • 回滚:升级前写下回滚命令和责任人;不要等界面打不开时才寻找旧标签或备份位置。

常见故障速查

现象 先检查 处理方向
ollama 命令找不到 新开 PowerShell、安装路径、系统版本 从官方安装器修复,避免第三方包
模型下载很慢或中断 磁盘空间、代理、网络与防病毒扫描 保留空间后重试 ollama pull
回答极慢 任务管理器中的 RAM/VRAM、CPU/GPU 利用率 换小模型、缩短上下文、减少并发
Open WebUI 看不到模型 宿主 11434、容器日志、Ollama URL 使用 host.docker.internal
知识库不引用文档 抽取文本和检索结果 修复 OCR/切分/索引,再调模型
删除文档后仍被回答 知识库索引、聊天历史、缓存与备份 分别删除并重建索引,验证残留

官方资料与编辑复核

编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 17 日重写。旧稿把本地部署描述为不会泄露、一定更快,并把上传知识库称为训练,还使用了已变化的 8B 型号与安装界面描述;新稿改为可核验的 Ollama、Open WebUI、模型选择、RAG 引用验收和本地安全流程。本站的来源、更新与纠错原则见关于本站与编辑规范