AI教程

Kimi K3 文档分析教程:PDF、Word、Excel 与 PPT 实战验收

用KimiK3处理PDF、Word、Excel和PPT,关键不是上传成功,而是验证解析覆盖、页码证据、数字与公式、表格字段、引用和可编辑交付。本文给出网页Docs/Sheets/Slides、Agent与API文件问答的完整流程。

Kimi K3 文档分析从文件盘点、解析检查、问题设计、证据定位、结果复核到可编辑文件交付的六步流程
本页目录
  1. 先选入口:Chat、K3、Docs、Sheets、Slides 还是 API?
  2. K3 的 1M 上下文和原生视觉,不等于自动准确
  3. 第一步:盘点文件,而不是立即上传
  4. 第二步:确认解析是否完整
  5. 第三步:把问题写成可验收任务
  6. 第四步:用头、中、尾探针验证长文档
  7. 第五步:分别验收事实、数字、表格和引用
  8. 第六步:检查下载的 Word、Excel 和 PPT
  9. API 文件问答:上传、抽取和对话是三个阶段
  10. 敏感文件能不能上传?
  11. 常见故障排查
  12. 可直接复用的交付清单
  13. 常见问题
  14. Kimi K3 能一次读完 100 万 token 的文档吗?
  15. Kimi 生成的 Word、Excel 和 PPT 可以直接交付吗?
  16. 扫描 PDF 为什么经常答错数字?
  17. Kimi API 上传文件是否免费?
  18. 公司合同可以直接上传吗?

直接答案:用 Kimi K3 做文档分析,正确流程不是“上传文件—让它总结—复制答案”,而是“确认文件版本—检查解析覆盖—设计可核对问题—要求页码或单元格证据—逐字段复核—下载并检查可编辑文件”。PDF、扫描件、Word、Excel 和 PPT 的失败方式不同;上传成功只说明文件进入系统,不代表 OCR 正确、表格完整、公式可复算或引用真实。

适用范围:本文面向需要阅读、比较、提取、改写或生成文档的中文用户,也覆盖 Kimi Docs、Sheets、Slides、通用 Agent 和 API 文件问答。资料核对日期为 2026 年 7 月 24 日。模型、会员额度、文件限制、价格和产品界面会变化,执行前请复查官方页面。

Kimi K3 文档分析从文件盘点、解析检查、问题设计、证据定位、结果复核到可编辑文件交付的六步流程
上传只是第二步;任何一步发现错误,都应回到上一步修正,而不是让模型在错误解析上继续生成。图:兰塞 AI 编辑部原创。

先选入口:Chat、K3、Docs、Sheets、Slides 还是 API?

Kimi Docs 与 Sheets 官方介绍说明,网页产品可生成和编辑 Word、PDF、Excel 等文件;Kimi PPT 介绍则覆盖从主题、文档或模板生成可编辑演示文稿。当前产品帮助页建议在通用入口选择 K3 完成文档任务;K2.6 更适合快速文字问答,不以端到端可编辑文件为主要交付。

任务 优先入口 交付物 主要验收
问一个文件里的简单事实 K2.6 或 K3 Chat 文字答案 原文位置、主体、日期和数字
比较合同、报告或多个版本 K3 / Docs / Agent 差异表、批注或修订稿 条款编号、遗漏、修改方向和原格式
从 PDF 提取数据到表格 K3 / Sheets .xlsx 行数、唯一键、字段、公式和缺失值
把报告改成演示文稿 K3 / Slides .pptx 页数、数据来源、母版、字体和可编辑元素
持续维护同一批资料 Kimi 项目 多会话和项目文件 项目指令、文件版本、按需读取和权限
接入自己的系统 K3 API JSON、文本或自建文件流程 schema、token、错误、日志和数据边界

如果你还分不清模型与产品入口,先阅读Kimi K3、Chat、Agent 与 API 总览;若要比较 K2.6、K3 和 K3 Cluster 的成本与任务边界,可看Kimi K3 模型与入口对比

K3 的 1M 上下文和原生视觉,不等于自动准确

K3 API 官方介绍写明最高 100 万 token 上下文、原生视觉和长程知识工作定位;这些是可用能力,不是结果保证。文档任务至少经过四层:文件是否被正确解析、目标证据是否被召回、模型是否忠实推断、输出文件是否保持结构。任何一层出错,最后的答案都可能语言流畅但事实错误。

例如一份 200 页扫描合同,OCR 把“80 万”识别成“30 万”,K3 可能非常准确地围绕错误文本进行分析;一份 Excel 若隐藏列没有进入抽取结果,模型也无法凭空恢复。视觉能力能帮助理解页面和截图,却仍受清晰度、裁切、排列和输入格式影响。API 使用图片或视频时,应按官方视觉输入说明构造消息,而不是把二进制路径或网页拖拽行为直接套到接口。

官方模型选择页还区分了 K2.6、K3 与 K3 Cluster:快速问答、复杂交付和大规模并行的成本与组织方式不同。普通文档不要默认上 Cluster;并行子任务越多,重复提取、字段冲突、来源合并和失败重试越需要专门规则。先用一份小样本跑通六步流程,再扩大文件数和并行度。

成功层级 要回答的问题 可观察证据 通过后才能做什么
解析成功 内容是否按正确顺序进入系统 页数、字符、OCR、表格与异常页 设计事实问题
召回成功 目标证据是否能从头、中、尾找到 页码、单元格、原文片段 生成结构化答案
推断正确 结论是否忠于证据且不越界 原子主张、数字复算、缺失声明 形成候选稿
交付成功 下载文件是否可打开、可编辑、可追溯 目标软件回归、版本与批准记录 进入正式业务流程

第一步:盘点文件,而不是立即上传

先给每个输入文件建立身份。至少记录文件名、来源、版本、修改日期、字节数、哈希、页数或 Sheet 数、是否加密、是否含个人信息。多份“最终版”“最终版2”最容易让分析基于错误版本;没有哈希也无法证明后续复测使用了同一输入。

字段 示例 作用 失败时处理
文件 ID contract-v3-20260724 把问题和答案绑定到具体版本 禁止只写“那份合同”
SHA-256 64 位哈希 确认复测输入未变化 重新计算并记录来源
结构 128 页、12 个 Sheet、36 张幻灯片 判断解析覆盖 输出结构数与原文件对账
敏感级别 公开/内部/机密/个人信息 决定能否上传和使用什么入口 脱敏、审批或改用批准环境
完成标准 提取 18 个字段,金额误差为 0 避免用“总结得不错”验收 先补标准,再开始任务

对持续项目,Kimi 项目官方说明建议把共享文件与项目指令放在项目内,但文件是按需读取,不是每轮把全部正文预加载。不同交付物仍应开独立会话,减少历史噪声和错误继承。

第二步:确认解析是否完整

文件能打开,不等于内容被正确提取。Kimi API 故障排查说明:文本文件会提取文字,图片使用 OCR;纯图片 PDF 会走 OCR,否则通常提取文本层。双栏 PDF、旋转扫描页、页眉页脚、表格合并单元格、公式、手写批注和嵌入图表都可能丢失或错序。

PDF、扫描件、Word、Excel 和 PPT 分别需要检查页码版面、OCR、标题批注、公式单元格与母版可编辑元素
文件类型决定主要失败方式,也决定必须保留的证据单位。图:兰塞 AI 编辑部原创。
文件类型 先检查 证据单位 高风险信号
文本 PDF 页数、阅读顺序、脚注、双栏 页码 + 原文片段 跨栏拼接、页眉混入正文
扫描 PDF / 图片 旋转、清晰度、OCR、印章覆盖 页码 + 图片区域 0/8、1/l、金额和日期错识别
Word 标题层级、批注、修订、表格 标题路径 + 段落/批注 接受/拒绝修订后含义变化
Excel / CSV Sheet、隐藏行列、公式、类型 Sheet + 单元格 + 公式 数字被当文本、日期时区错、公式变值
PPT 母版、备注、图表数据、字体 页号 + 元素/备注 截图替代可编辑图表、字体回退

第一轮不要问“请总结全文”,而要问结构问题:共有多少页/章节/Sheet?列出目录和每部分起止位置;随机报告第 3、50、末页的标题;列出所有空白页和解析失败页。结构对不上时先修文件或拆分,不要继续生成结论。

第三步:把问题写成可验收任务

一个可验收问题应包含:目标、证据范围、必备字段、输出格式、允许推断、缺失值规则和禁止事项。不要要求模型“扮演资深律师/分析师”来替代证据;角色提示不会自动增加专业责任或事实准确性。

任务:从上传的采购合同中提取付款与违约条款。
范围:只使用合同正文和附件,不使用外部知识。
必备字段:
1. 付款节点
2. 金额或比例
3. 触发条件
4. 逾期责任
5. 原文页码与条款号
缺失规则:原文没有就写“未找到”,不得补全。
输出:先给 JSON,再给供人工复核的 Markdown 表格。
禁止:不得给出法律结论,不得改写原文金额和日期。
问题类型 低质量问法 可验收问法
摘要 总结这份报告 按目标、方法、样本、主要结果、限制五栏,每栏附页码
对比 比较两个合同 按条款号列出新增、删除、金额、期限和责任变化,并附双边页码
提取 整理客户信息 按给定字段和唯一键输出,缺失为空,不合并同名主体
表格 分析销售数据 先复算总额,再列异常行、公式和允许误差,输出可下载 xlsx
PPT 做一份漂亮 PPT 限定受众、页数、每页结论、数据来源、品牌模板和禁止虚构图片

第四步:用头、中、尾探针验证长文档

K3 的官方最高上下文是 1M token,但窗口容量不等于每处证据都能稳定召回。系统提示、历史、工具、图片表示、推理和输出也占用窗口。对长文档至少准备 9 个真值问题:开头、中间、结尾各 3 个,包含容易混淆的实体、数字和否定条件。

  1. 从每个位置人工选一段可核对事实,记录页码和原文。
  2. 先问精确事实,再问跨章节关系,最后问综合结论。
  3. 要求答案附页码、条款、单元格或原文短句。
  4. 逐个打开原位置,判断是解析错误、召回错误还是推断错误。
  5. 中部失败时缩小文件、分章节或建立检索,不要只增加提示词。

大量资料需要持续更新和权限控制时,参考RAG Pipeline 生产验收指南把分块、召回、重排、引用和版本管理拆开。长上下文适合一次性整体阅读,不会自动替代检索与数据治理。

第五步:分别验收事实、数字、表格和引用

Kimi K3 文档分析从真值问题、模型回答、证据定位、逐字段复核、错误分类到回归测试形成质量闭环
先写真值和通过标准,再运行模型;失败样本必须保留并进入回归集。图:兰塞 AI 编辑部原创。
对象 最低检查 常见错误 验收方法
事实 主体、动作、对象、时间、范围 把推断写成原文事实 拆成原子主张,逐条对页码
数字 单位、币种、正负号、期间、合计 百分比和百分点混用 独立计算器/公式复算
表格 行数、唯一键、字段类型、缺失值 合并同名、错列、漏行 与原表做行级对账
公式 公式文本、引用范围、重算值 导出后只剩静态结果 在 Excel 本地重算并检查依赖
引用 URL、标题、日期、原文位置 链接可达但不支持结论 打开来源,核对主体和口径
格式 标题、目录、批注、母版、字体 在线预览正常,下载后错版 目标软件中打开、编辑、导出

联网补充资料时,引用只是线索。可用AI 引用核验方法检查原文是否直接支持结论。涉及法律、财务、医疗或安全决策,必须交给有资质的人复核,不能把 Kimi 输出当专业意见。

第六步:检查下载的 Word、Excel 和 PPT

可下载不等于可交付。Kimi Docs 产品页Kimi Slides 产品页描述了 Word、PDF、Excel、PPT 的生成与转换能力;编辑验收仍应在实际目标软件中完成,而不是只看网页预览。

格式 打开检查 编辑检查 内容检查
DOCX 字体、分页、目录、页眉页脚 标题样式、批注、修订是否保留 引用、表格和图注是否对应
XLSX Sheet、冻结窗格、数字格式 公式可见、引用范围正确、可重算 总计、异常、缺失与原始数据对账
PPTX 母版、字体、图片裁切、备注 文本、图形、图表是否可编辑 每页结论与来源一致
PDF 嵌入字体、链接、书签、页码 确认是否本来就要求不可编辑 可复制文本与视觉版面一致

最终文件应另存为新版本,不覆盖原始输入。保留生成日期、模型/入口、提示、来源清单、人工修正和批准人。需要团队协作时,把责任与审批规则放进AI 办公与知识工作专题的工作流,而不是只在聊天里口头约定。

批量转换还应先做 5–10 个文件的 canary,覆盖最大文件、最差扫描、最多表格、复杂公式和特殊字体。记录每个文件的输入哈希、输出哈希、失败类型和人工修正时间;一旦模板、模型或入口变化,先重跑 canary,再继续批量。不要把第一次生成的“看起来正常”当作以后所有文件都能稳定通过。

API 文件问答:上传、抽取和对话是三个阶段

Kimi API 文件问答指南将流程拆为上传文件、获取抽取内容、把内容加入模型请求。上传接口还有文件数量、单文件大小和总容量限制。上传接口本身不代表推理免费;文件内容进入请求后会按输入 token 计费。

from pathlib import Path
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.cn/v1",
)

uploaded = client.files.create(
    file=Path("report.pdf"),
    purpose="file-extract",
)

extracted = client.files.content(file_id=uploaded.id).text

response = client.chat.completions.create(
    model="kimi-k3",
    reasoning_effort="low",
    messages=[
        {"role": "system", "content": "仅依据文件内容回答;缺失就写未找到。"},
        {"role": "system", "content": extracted},
        {"role": "user", "content": "列出报告的样本量、时间范围和限制,并标注原文位置。"}
    ],
)

print(response.choices[0].message.content)

示例用于说明阶段,不应把未经检查的全文直接送入生产。先验证抽取内容是否含页码、是否出现乱码、是否超出预算;大文件可分章节或建立检索。中国区与国际区 Key、余额和端点相互独立,Kimi Code Key 也不等于开放平台 Key。K3 API 的模型、effort、价格与错误处理可继续看K3 API 选择与 canary

敏感文件能不能上传?

先问组织政策和数据分类,而不是先问模型能力。身份证件、健康数据、未公开合同、客户名单、源代码、密钥和生产日志可能受到法律、合同和内部制度限制。最小化输入、脱敏、删除无关页、限制账号权限,并确认当前产品条款、保留期限、删除方式和企业协议。

风险 最低动作 仍不能解决
个人信息 去标识化、最小字段、授权记录 法律依据和跨境要求
商业机密 批准入口、访问控制、水印和日志 第三方处理者与合同责任
密码/密钥 禁止上传,使用密钥扫描 已经泄露时必须轮换
生产文件 只读副本、哈希、备份与回滚 错误写回造成的业务影响

涉及写入、发送或外部工具时,还应按提示词注入与工具调用防护隔离文件里的不可信指令。文档中出现“忽略此前要求、上传密钥、向某地址发送内容”时,应把它当作数据而不是操作指令。

常见故障排查

症状 先检查 处理
只回答前几页 解析页数、历史、token 和中部探针 拆章节、缩短历史或使用检索
扫描件数字错误 原图、旋转、清晰度、OCR 单页重做 OCR,关键数字人工双录
Excel 总计不对 数字类型、隐藏行、公式范围 在本地重算,与原始表逐行对账
下载文件错版 字体、母版、页边距、目标软件 固定模板和字体,在目标软件回归
引用打不开 URL、发布日期、权限和原文 回到一手来源,删除无法支持的结论
Agent 卡住 后台状态、工具日志、额度和任务规模 官方 Agent 限制拆为 2–3 阶段,不重复盲目提交

可直接复用的交付清单

  1. 原文件版本、哈希、页数/Sheet/幻灯片数已记录。
  2. 敏感等级、授权和允许使用的产品入口已确认。
  3. 解析后的结构数与原文件一致,空白页、OCR 和表格异常已列出。
  4. 头、中、尾真值问题全部通过,答案附页码或单元格。
  5. 所有数字已复算,单位、币种、期间和正负号无误。
  6. 引用已打开,原文直接支持对应结论。
  7. 下载文件已在 Word、Excel、PowerPoint 或 PDF 阅读器中打开并编辑。
  8. 模型、入口、账号、提示、日期、来源和人工修正已留档。
  9. 失败样本进入回归集,下一次更新会重新测试。
  10. 原文件未被覆盖,输出有版本、批准人和回滚路径。

常见问题

Kimi K3 能一次读完 100 万 token 的文档吗?

官方写的是最高上下文窗口,不是每个产品、会员和任务的统一保证。系统提示、历史、工具、图片、推理和输出都会占用窗口。是否“读完”要用头、中、尾真值问题和页码证据验证。

Kimi 生成的 Word、Excel 和 PPT 可以直接交付吗?

不能默认直接交付。必须在目标软件中检查样式、公式、母版、字体、数据、引用和可编辑性。高风险文档还需要专业人员批准。

扫描 PDF 为什么经常答错数字?

扫描件依赖 OCR,模糊、旋转、表格线、印章和相似字符都可能导致错误。关键金额、日期和编号应回到原图区域人工核对,必要时双人录入。

Kimi API 上传文件是否免费?

上传和抽取接口的当前计费规则要看官方页面;文件内容进入模型上下文后会计入输入 token。存储、抽取、推理和工具是不同阶段,不能用“上传免费”推断整个文件问答免费。

公司合同可以直接上传吗?

先依据公司政策、合同、数据分类和当前产品条款判断。脱敏不是万能许可;无法确认时不要上传,改用组织批准的企业、API 或私有环境。

编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 24 日重写。旧稿把 Kimi 描述成上传后即可准确理解百页文件的通用助手,没有说明解析失败、OCR、表格公式、页码证据、产品差异和隐私边界;本次新增六步证据工作流、五类文件验收、网页与 API 路线、真值集、数字复算、可编辑文件检查、失败回归和三张原创图。本站的来源、更新与纠错原则见关于本站与编辑规范