直接回答:Windows 10/11 用户可以先安装 Ollama,用 ollama run deepseek-r1:8b 下载并运行当前 8B 蒸馏模型,再通过 Docker 启动 Open WebUI,把它连接到宿主机的 http://host.docker.internal:11434。上传文档后应验证检索片段和引用,而不是把“能回答”误认为“已经训练了专属模型”。
本文按 2026 年 7 月 17 日的 Ollama 模型库、DeepSeek‑R1 官方仓库和 Open WebUI 文档复核。模型标签、镜像版本和菜单会更新,执行前请同时打开文中的官方链接确认。只想了解 R1、R1‑Zero 与蒸馏模型的原理,可先看DeepSeek‑R1 原理与部署指南。

开始前:本地部署能解决什么,不能保证什么?
本地运行的主要价值是锁定模型版本、减少每次问答对外部 API 的依赖,并让文档和聊天数据保留在自己控制的设备与容器中。但“本地”不是绝对安全,也不一定更快:恶意软件、共享 Windows 账户、浏览器扩展、云盘同步、未加密磁盘、开放的 11434/3000 端口和错误的容器配置仍可能泄露数据。
| 常见说法 | 更准确的判断 | 你要验证什么 |
|---|---|---|
| 本地部署绝不泄露 | 减少外部传输,但风险转移到本机、账户和网络 | 磁盘加密、账户权限、端口、防火墙、备份与同步 |
| 本地一定更快 | 速度由 CPU/GPU、内存、模型大小和上下文决定 | 首 token 时间、生成速度、内存峰值和温度 |
| 上传文档就是训练 | Open WebUI Knowledge 通常使用 RAG 检索相关片段 | 抽取文本、检索命中、引用和无答案拒答 |
| 8B 就是完整 R1 | Ollama 默认 8B 是蒸馏模型,不是 671B 完整权重 | 标签、模型卡、基础模型与许可证 |
第一步:根据电脑资源选择 DeepSeek‑R1 模型
不要先下载最大模型。Ollama 当前 DeepSeek‑R1 模型库列出多个尺寸,其中默认 deepseek-r1 与 deepseek-r1:8b 对应 R1‑0528‑Qwen3‑8B,下载体积约 5.2GB;7B 约 4.7GB、14B 约 9.0GB、32B 约 20GB。下载体积不是最低运行内存:上下文、KV Cache、并发和 GPU/CPU 分配还会增加占用。
| 标签 | 模型库体积 | 适合起步场景 | 注意 |
|---|---|---|---|
deepseek-r1:1.5b |
约 1.1GB | 低资源试跑、验证安装链路 | 复杂推理和知识库综合能力有限 |
deepseek-r1:7b |
约 4.7GB | 普通问答、轻量文档检索 | Qwen 蒸馏版,先用短上下文 |
deepseek-r1:8b |
约 5.2GB | 当前较均衡的默认起点 | R1‑0528‑Qwen3‑8B,旧教程可能指向 Llama 8B |
deepseek-r1:14b |
约 9.0GB | 更高质量、较强工作站 | 需要更多 RAM/VRAM,CPU 生成可能较慢 |
deepseek-r1:32b |
约 20GB | 高资源工作站、复杂任务 | 不适合作为普通电脑的首次下载 |
DeepSeek 官方R1 仓库说明,1.5B/7B/14B/32B 源自 Qwen 2.5 系列蒸馏,8B 和 70B 另有 Llama 衍生关系;当前 Ollama 8B 标签已更新为 Qwen3 版本,因此写教程必须同时注明“标签”和复核日期。查看当前 DeepSeek 官网、API 和开放权重关系,可参考DeepSeek 完整入口与选型指南。
第二步:在 Windows 安装并验证 Ollama
Ollama 官方Windows 下载页要求 Windows 10 或更高版本。对新手更稳妥的做法是从官方页面下载安装包并确认域名,而不是从第三方下载站获取。安装完成后打开新的 PowerShell 窗口:
ollama --version
ollama list
Invoke-RestMethod http://localhost:11434/api/tags
第一条确认命令可用,第二条列出已下载模型,第三条确认本机 Ollama API 正在监听。Ollama Windows 服务通常在后台提供 localhost:11434;不要为了连接本机界面就把它暴露到公网。
下载并运行模型
ollama run deepseek-r1:8b
首次运行会下载数 GB 权重,时间取决于网络和磁盘。进入对话后先做两类检查:一类是简单事实和中文指令,确认模型正常输出;另一类是你真实任务的短样本,记录速度和内存。结束交互可输入 /bye。以后更新同一标签可使用:
ollama pull deepseek-r1:8b
更新会改变实际权重,生产或长期研究环境应记录 ollama list、标签和更新时间;不要在没有回归测试时静默更新。Ollama 当前模型页面还提供 1.5B、7B、14B、32B、70B 与 671B 等标签,但 671B 权重体积约 404GB,远超普通 Windows 电脑的合理起步范围。
第三步:安装 Open WebUI 并连接宿主机 Ollama
Open WebUI 官方把 Docker 列为推荐安装路径。先安装并启动 Docker Desktop,然后在 PowerShell 执行下面的命令。它把网页映射到本机 3000 端口,把数据保存在 Docker volume,并通过 Windows/Docker 的宿主地址连接 Ollama:
docker run -d `
-p 3000:8080 `
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 `
-v open-webui:/app/backend/data `
--name open-webui `
--restart always `
ghcr.io/open-webui/open-webui:main
命令依据 Open WebUI Quick Start和Ollama 连接文档整理。打开 http://localhost:3000 后创建本地管理员账户。若界面没有模型,先检查:
- 宿主 PowerShell 中
Invoke-RestMethod http://localhost:11434/api/tags是否返回模型。 docker ps是否显示 Open WebUI 容器正在运行。docker logs open-webui --tail 100是否出现连接错误。- Open WebUI 的 Ollama URL 是否为
http://host.docker.internal:11434,不是容器内的localhost。 - Windows 防火墙或安全软件是否阻止 Docker 访问宿主服务。
版本提醒:main 会随项目更新。个人试用方便,但正式环境应阅读官方版本说明、固定经过验证的镜像标签并备份 volume,不能把“自动更新”当作无风险操作。
第四步:建立知识库,而不是“训练专属模型”
在 Open WebUI 的 Workspace/Knowledge 中创建知识集合并上传已获授权的 PDF、Office、文本或代码文件。官方 Knowledge 文档把它描述为检索增强:系统抽取和索引文档,提问时寻找相关片段,再把片段交给模型回答。权重通常没有发生训练或微调。
| 阶段 | 要检查的证据 | 常见失败 |
|---|---|---|
| 文档抽取 | 页码、标题、表格、OCR 文本可读 | 扫描 PDF 没有 OCR、乱码、表格错列 |
| 切分与索引 | 片段保留来源、章节和更新时间 | 切得太碎丢上下文,太长又检索不准 |
| 检索 | 真实问题能召回正确原文 | 关键词变体、简称或跨章节问题未命中 |
| 回答 | 结论能逐句回到文档证据 | 模型把常识、旧知识和文档混在一起 |
| 拒答 | 文档没有答案时明确说不知道 | 为了“有帮助”而编造不存在的条款 |
用一组可复核问题验收
- 直接问题:答案明确写在某一页,检查是否引用正确片段。
- 改写问题:不用文档原词提问,检查语义检索是否仍能命中。
- 跨段问题:答案需要两处证据,检查是否遗漏限制条件。
- 版本问题:上传新旧两版制度,检查回答是否说明日期和冲突。
- 无答案问题:故意询问文档不存在的数字,模型应拒答或提示缺证据。
- 恶意文档:文档中的“忽略系统规则”等文本不应改变应用权限。
若答案错,先看检索片段是否正确:片段就错,调整抽取、OCR、切分、嵌入和检索;片段正确但回答错,再调整提示、模型和上下文。不要只换更大模型掩盖索引问题。
第五步:把“完全离线”和安全边界说清楚
完成模型、嵌入模型和容器镜像下载后,Ollama 推理可以不依赖外部 API。但 Open WebUI 可能配置网页搜索、外部模型、更新检查或其他连接;Windows 也可能运行 OneDrive、第三方同步、远程管理和安全软件。因此“完全离线”应通过网络观察和配置证明,而不是根据产品名称推断。
- 只把 11434 和 3000 绑定在可信本机/局域网范围,不直接暴露公网。
- 为 Windows、Open WebUI 和共享文件分别设置账户与最小权限。
- 敏感文档进入知识库前确认授权、保留期限、删除和备份策略。
- 关闭不需要的网页搜索、外部 API、遥测或插件,并检查实际网络连接。
- 对 Docker volume、Ollama 模型目录和原始文档做加密备份;定期验证恢复。
- 多人使用时不要共用管理员账号;删除知识库时同时核对索引、原文件和备份。
企业或多人环境还应加入审计、漏洞修复、数据分级和事件响应,详见DeepSeek 企业落地与安全治理指南。若要让模型调用文件、数据库或脚本,则需进一步实施AI 智能体权限与审批边界。
如何判断本机资源够不够?
与其照抄“16GB 内存可运行”一类结论,不如用同一组任务做一次本机容量测试。先关闭不必要的大型应用,在 Windows 任务管理器的“性能”页观察内存、专用 GPU 内存、共享 GPU 内存和磁盘;再从短上下文开始,让模型分别完成一次问答、长回答和知识库检索。测试过程中不要同时下载模型,否则磁盘和网络会干扰结果。
| 记录项 | 为什么重要 | 可接受条件由谁决定 |
|---|---|---|
| 模型标签与更新时间 | 同一标签更新后能力和资源可能变化 | 项目负责人固定版本基线 |
| 首 token 等待时间 | 决定交互是否让用户误以为卡死 | 按真实工作节奏设上限 |
| 持续生成速度 | 决定长回答和批量任务耗时 | 与更小模型或在线方案比较 |
| RAM/VRAM 峰值 | 接近满载会触发换页、卡顿或失败 | 为系统和并发保留余量 |
| 答案与引用正确性 | 快但错误的模型不适合知识库 | 用固定验收集人工复核 |
| 温度、噪声和稳定性 | 持续高负载不同于一次演示 | 按设备散热与使用时长判断 |
如果 8B 已经频繁占满内存或等待过长,优先缩短上下文、关闭并发或退到 7B/1.5B;如果速度可接受但答案不足,再考虑 14B。不要只因磁盘还能容纳 32B 就认为它适合持续运行。
更新、备份和回滚怎么做?
Ollama 模型、Open WebUI 容器和知识库数据是三套不同资产。更新前分别记录状态,不能只备份原始 PDF:
ollama list
docker inspect open-webui
docker volume inspect open-webui
docker logs open-webui --tail 100
- 模型:记录标签、更新时间和固定验收集;
ollama pull后先回归,再替换日常使用版本。 - 界面:生产使用应固定经过验证的 Open WebUI 镜像标签。升级前查看发行说明并保留旧镜像,失败时可按旧配置重新创建容器。
- 数据:定期备份 Docker volume,并验证能够恢复用户、聊天、连接和知识库;备份文件本身也需要加密和访问控制。
- 文档:保存原始文件、版本日期和授权记录。知识库索引可以重建,但缺失的原文和版本关系无法靠向量库恢复。
- 回滚:升级前写下回滚命令和责任人;不要等界面打不开时才寻找旧标签或备份位置。
常见故障速查
| 现象 | 先检查 | 处理方向 |
|---|---|---|
ollama 命令找不到 |
新开 PowerShell、安装路径、系统版本 | 从官方安装器修复,避免第三方包 |
| 模型下载很慢或中断 | 磁盘空间、代理、网络与防病毒扫描 | 保留空间后重试 ollama pull |
| 回答极慢 | 任务管理器中的 RAM/VRAM、CPU/GPU 利用率 | 换小模型、缩短上下文、减少并发 |
| Open WebUI 看不到模型 | 宿主 11434、容器日志、Ollama URL | 使用 host.docker.internal |
| 知识库不引用文档 | 抽取文本和检索结果 | 修复 OCR/切分/索引,再调模型 |
| 删除文档后仍被回答 | 知识库索引、聊天历史、缓存与备份 | 分别删除并重建索引,验证残留 |
官方资料与编辑复核
- Ollama Windows 官方下载
- Ollama DeepSeek‑R1 模型库
- DeepSeek‑R1 官方仓库与模型说明
- Open WebUI Quick Start
- Open WebUI 连接 Ollama
- Open WebUI Knowledge / RAG 文档
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 17 日重写。旧稿把本地部署描述为不会泄露、一定更快,并把上传知识库称为训练,还使用了已变化的 8B 型号与安装界面描述;新稿改为可核验的 Ollama、Open WebUI、模型选择、RAG 引用验收和本地安全流程。本站的来源、更新与纠错原则见关于本站与编辑规范。
