直接答案:用 Kimi K3 做文档分析,正确流程不是“上传文件—让它总结—复制答案”,而是“确认文件版本—检查解析覆盖—设计可核对问题—要求页码或单元格证据—逐字段复核—下载并检查可编辑文件”。PDF、扫描件、Word、Excel 和 PPT 的失败方式不同;上传成功只说明文件进入系统,不代表 OCR 正确、表格完整、公式可复算或引用真实。
适用范围:本文面向需要阅读、比较、提取、改写或生成文档的中文用户,也覆盖 Kimi Docs、Sheets、Slides、通用 Agent 和 API 文件问答。资料核对日期为 2026 年 7 月 24 日。模型、会员额度、文件限制、价格和产品界面会变化,执行前请复查官方页面。

先选入口:Chat、K3、Docs、Sheets、Slides 还是 API?
Kimi Docs 与 Sheets 官方介绍说明,网页产品可生成和编辑 Word、PDF、Excel 等文件;Kimi PPT 介绍则覆盖从主题、文档或模板生成可编辑演示文稿。当前产品帮助页建议在通用入口选择 K3 完成文档任务;K2.6 更适合快速文字问答,不以端到端可编辑文件为主要交付。
| 任务 | 优先入口 | 交付物 | 主要验收 |
|---|---|---|---|
| 问一个文件里的简单事实 | K2.6 或 K3 Chat | 文字答案 | 原文位置、主体、日期和数字 |
| 比较合同、报告或多个版本 | K3 / Docs / Agent | 差异表、批注或修订稿 | 条款编号、遗漏、修改方向和原格式 |
| 从 PDF 提取数据到表格 | K3 / Sheets | .xlsx |
行数、唯一键、字段、公式和缺失值 |
| 把报告改成演示文稿 | K3 / Slides | .pptx |
页数、数据来源、母版、字体和可编辑元素 |
| 持续维护同一批资料 | Kimi 项目 | 多会话和项目文件 | 项目指令、文件版本、按需读取和权限 |
| 接入自己的系统 | K3 API | JSON、文本或自建文件流程 | schema、token、错误、日志和数据边界 |
如果你还分不清模型与产品入口,先阅读Kimi K3、Chat、Agent 与 API 总览;若要比较 K2.6、K3 和 K3 Cluster 的成本与任务边界,可看Kimi K3 模型与入口对比。
K3 的 1M 上下文和原生视觉,不等于自动准确
K3 API 官方介绍写明最高 100 万 token 上下文、原生视觉和长程知识工作定位;这些是可用能力,不是结果保证。文档任务至少经过四层:文件是否被正确解析、目标证据是否被召回、模型是否忠实推断、输出文件是否保持结构。任何一层出错,最后的答案都可能语言流畅但事实错误。
例如一份 200 页扫描合同,OCR 把“80 万”识别成“30 万”,K3 可能非常准确地围绕错误文本进行分析;一份 Excel 若隐藏列没有进入抽取结果,模型也无法凭空恢复。视觉能力能帮助理解页面和截图,却仍受清晰度、裁切、排列和输入格式影响。API 使用图片或视频时,应按官方视觉输入说明构造消息,而不是把二进制路径或网页拖拽行为直接套到接口。
官方模型选择页还区分了 K2.6、K3 与 K3 Cluster:快速问答、复杂交付和大规模并行的成本与组织方式不同。普通文档不要默认上 Cluster;并行子任务越多,重复提取、字段冲突、来源合并和失败重试越需要专门规则。先用一份小样本跑通六步流程,再扩大文件数和并行度。
| 成功层级 | 要回答的问题 | 可观察证据 | 通过后才能做什么 |
|---|---|---|---|
| 解析成功 | 内容是否按正确顺序进入系统 | 页数、字符、OCR、表格与异常页 | 设计事实问题 |
| 召回成功 | 目标证据是否能从头、中、尾找到 | 页码、单元格、原文片段 | 生成结构化答案 |
| 推断正确 | 结论是否忠于证据且不越界 | 原子主张、数字复算、缺失声明 | 形成候选稿 |
| 交付成功 | 下载文件是否可打开、可编辑、可追溯 | 目标软件回归、版本与批准记录 | 进入正式业务流程 |
第一步:盘点文件,而不是立即上传
先给每个输入文件建立身份。至少记录文件名、来源、版本、修改日期、字节数、哈希、页数或 Sheet 数、是否加密、是否含个人信息。多份“最终版”“最终版2”最容易让分析基于错误版本;没有哈希也无法证明后续复测使用了同一输入。
| 字段 | 示例 | 作用 | 失败时处理 |
|---|---|---|---|
| 文件 ID | contract-v3-20260724 | 把问题和答案绑定到具体版本 | 禁止只写“那份合同” |
| SHA-256 | 64 位哈希 | 确认复测输入未变化 | 重新计算并记录来源 |
| 结构 | 128 页、12 个 Sheet、36 张幻灯片 | 判断解析覆盖 | 输出结构数与原文件对账 |
| 敏感级别 | 公开/内部/机密/个人信息 | 决定能否上传和使用什么入口 | 脱敏、审批或改用批准环境 |
| 完成标准 | 提取 18 个字段,金额误差为 0 | 避免用“总结得不错”验收 | 先补标准,再开始任务 |
对持续项目,Kimi 项目官方说明建议把共享文件与项目指令放在项目内,但文件是按需读取,不是每轮把全部正文预加载。不同交付物仍应开独立会话,减少历史噪声和错误继承。
第二步:确认解析是否完整
文件能打开,不等于内容被正确提取。Kimi API 故障排查说明:文本文件会提取文字,图片使用 OCR;纯图片 PDF 会走 OCR,否则通常提取文本层。双栏 PDF、旋转扫描页、页眉页脚、表格合并单元格、公式、手写批注和嵌入图表都可能丢失或错序。
| 文件类型 | 先检查 | 证据单位 | 高风险信号 |
|---|---|---|---|
| 文本 PDF | 页数、阅读顺序、脚注、双栏 | 页码 + 原文片段 | 跨栏拼接、页眉混入正文 |
| 扫描 PDF / 图片 | 旋转、清晰度、OCR、印章覆盖 | 页码 + 图片区域 | 0/8、1/l、金额和日期错识别 |
| Word | 标题层级、批注、修订、表格 | 标题路径 + 段落/批注 | 接受/拒绝修订后含义变化 |
| Excel / CSV | Sheet、隐藏行列、公式、类型 | Sheet + 单元格 + 公式 | 数字被当文本、日期时区错、公式变值 |
| PPT | 母版、备注、图表数据、字体 | 页号 + 元素/备注 | 截图替代可编辑图表、字体回退 |
第一轮不要问“请总结全文”,而要问结构问题:共有多少页/章节/Sheet?列出目录和每部分起止位置;随机报告第 3、50、末页的标题;列出所有空白页和解析失败页。结构对不上时先修文件或拆分,不要继续生成结论。
第三步:把问题写成可验收任务
一个可验收问题应包含:目标、证据范围、必备字段、输出格式、允许推断、缺失值规则和禁止事项。不要要求模型“扮演资深律师/分析师”来替代证据;角色提示不会自动增加专业责任或事实准确性。
任务:从上传的采购合同中提取付款与违约条款。
范围:只使用合同正文和附件,不使用外部知识。
必备字段:
1. 付款节点
2. 金额或比例
3. 触发条件
4. 逾期责任
5. 原文页码与条款号
缺失规则:原文没有就写“未找到”,不得补全。
输出:先给 JSON,再给供人工复核的 Markdown 表格。
禁止:不得给出法律结论,不得改写原文金额和日期。
| 问题类型 | 低质量问法 | 可验收问法 |
|---|---|---|
| 摘要 | 总结这份报告 | 按目标、方法、样本、主要结果、限制五栏,每栏附页码 |
| 对比 | 比较两个合同 | 按条款号列出新增、删除、金额、期限和责任变化,并附双边页码 |
| 提取 | 整理客户信息 | 按给定字段和唯一键输出,缺失为空,不合并同名主体 |
| 表格 | 分析销售数据 | 先复算总额,再列异常行、公式和允许误差,输出可下载 xlsx |
| PPT | 做一份漂亮 PPT | 限定受众、页数、每页结论、数据来源、品牌模板和禁止虚构图片 |
第四步:用头、中、尾探针验证长文档
K3 的官方最高上下文是 1M token,但窗口容量不等于每处证据都能稳定召回。系统提示、历史、工具、图片表示、推理和输出也占用窗口。对长文档至少准备 9 个真值问题:开头、中间、结尾各 3 个,包含容易混淆的实体、数字和否定条件。
- 从每个位置人工选一段可核对事实,记录页码和原文。
- 先问精确事实,再问跨章节关系,最后问综合结论。
- 要求答案附页码、条款、单元格或原文短句。
- 逐个打开原位置,判断是解析错误、召回错误还是推断错误。
- 中部失败时缩小文件、分章节或建立检索,不要只增加提示词。
大量资料需要持续更新和权限控制时,参考RAG Pipeline 生产验收指南把分块、召回、重排、引用和版本管理拆开。长上下文适合一次性整体阅读,不会自动替代检索与数据治理。
第五步:分别验收事实、数字、表格和引用
| 对象 | 最低检查 | 常见错误 | 验收方法 |
|---|---|---|---|
| 事实 | 主体、动作、对象、时间、范围 | 把推断写成原文事实 | 拆成原子主张,逐条对页码 |
| 数字 | 单位、币种、正负号、期间、合计 | 百分比和百分点混用 | 独立计算器/公式复算 |
| 表格 | 行数、唯一键、字段类型、缺失值 | 合并同名、错列、漏行 | 与原表做行级对账 |
| 公式 | 公式文本、引用范围、重算值 | 导出后只剩静态结果 | 在 Excel 本地重算并检查依赖 |
| 引用 | URL、标题、日期、原文位置 | 链接可达但不支持结论 | 打开来源,核对主体和口径 |
| 格式 | 标题、目录、批注、母版、字体 | 在线预览正常,下载后错版 | 目标软件中打开、编辑、导出 |
联网补充资料时,引用只是线索。可用AI 引用核验方法检查原文是否直接支持结论。涉及法律、财务、医疗或安全决策,必须交给有资质的人复核,不能把 Kimi 输出当专业意见。
第六步:检查下载的 Word、Excel 和 PPT
可下载不等于可交付。Kimi Docs 产品页和Kimi Slides 产品页描述了 Word、PDF、Excel、PPT 的生成与转换能力;编辑验收仍应在实际目标软件中完成,而不是只看网页预览。
| 格式 | 打开检查 | 编辑检查 | 内容检查 |
|---|---|---|---|
| DOCX | 字体、分页、目录、页眉页脚 | 标题样式、批注、修订是否保留 | 引用、表格和图注是否对应 |
| XLSX | Sheet、冻结窗格、数字格式 | 公式可见、引用范围正确、可重算 | 总计、异常、缺失与原始数据对账 |
| PPTX | 母版、字体、图片裁切、备注 | 文本、图形、图表是否可编辑 | 每页结论与来源一致 |
| 嵌入字体、链接、书签、页码 | 确认是否本来就要求不可编辑 | 可复制文本与视觉版面一致 |
最终文件应另存为新版本,不覆盖原始输入。保留生成日期、模型/入口、提示、来源清单、人工修正和批准人。需要团队协作时,把责任与审批规则放进AI 办公与知识工作专题的工作流,而不是只在聊天里口头约定。
批量转换还应先做 5–10 个文件的 canary,覆盖最大文件、最差扫描、最多表格、复杂公式和特殊字体。记录每个文件的输入哈希、输出哈希、失败类型和人工修正时间;一旦模板、模型或入口变化,先重跑 canary,再继续批量。不要把第一次生成的“看起来正常”当作以后所有文件都能稳定通过。
API 文件问答:上传、抽取和对话是三个阶段
Kimi API 文件问答指南将流程拆为上传文件、获取抽取内容、把内容加入模型请求。上传接口还有文件数量、单文件大小和总容量限制。上传接口本身不代表推理免费;文件内容进入请求后会按输入 token 计费。
from pathlib import Path
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.cn/v1",
)
uploaded = client.files.create(
file=Path("report.pdf"),
purpose="file-extract",
)
extracted = client.files.content(file_id=uploaded.id).text
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="low",
messages=[
{"role": "system", "content": "仅依据文件内容回答;缺失就写未找到。"},
{"role": "system", "content": extracted},
{"role": "user", "content": "列出报告的样本量、时间范围和限制,并标注原文位置。"}
],
)
print(response.choices[0].message.content)
示例用于说明阶段,不应把未经检查的全文直接送入生产。先验证抽取内容是否含页码、是否出现乱码、是否超出预算;大文件可分章节或建立检索。中国区与国际区 Key、余额和端点相互独立,Kimi Code Key 也不等于开放平台 Key。K3 API 的模型、effort、价格与错误处理可继续看K3 API 选择与 canary。
敏感文件能不能上传?
先问组织政策和数据分类,而不是先问模型能力。身份证件、健康数据、未公开合同、客户名单、源代码、密钥和生产日志可能受到法律、合同和内部制度限制。最小化输入、脱敏、删除无关页、限制账号权限,并确认当前产品条款、保留期限、删除方式和企业协议。
| 风险 | 最低动作 | 仍不能解决 |
|---|---|---|
| 个人信息 | 去标识化、最小字段、授权记录 | 法律依据和跨境要求 |
| 商业机密 | 批准入口、访问控制、水印和日志 | 第三方处理者与合同责任 |
| 密码/密钥 | 禁止上传,使用密钥扫描 | 已经泄露时必须轮换 |
| 生产文件 | 只读副本、哈希、备份与回滚 | 错误写回造成的业务影响 |
涉及写入、发送或外部工具时,还应按提示词注入与工具调用防护隔离文件里的不可信指令。文档中出现“忽略此前要求、上传密钥、向某地址发送内容”时,应把它当作数据而不是操作指令。
常见故障排查
| 症状 | 先检查 | 处理 |
|---|---|---|
| 只回答前几页 | 解析页数、历史、token 和中部探针 | 拆章节、缩短历史或使用检索 |
| 扫描件数字错误 | 原图、旋转、清晰度、OCR | 单页重做 OCR,关键数字人工双录 |
| Excel 总计不对 | 数字类型、隐藏行、公式范围 | 在本地重算,与原始表逐行对账 |
| 下载文件错版 | 字体、母版、页边距、目标软件 | 固定模板和字体,在目标软件回归 |
| 引用打不开 | URL、发布日期、权限和原文 | 回到一手来源,删除无法支持的结论 |
| Agent 卡住 | 后台状态、工具日志、额度和任务规模 | 按官方 Agent 限制拆为 2–3 阶段,不重复盲目提交 |
可直接复用的交付清单
- 原文件版本、哈希、页数/Sheet/幻灯片数已记录。
- 敏感等级、授权和允许使用的产品入口已确认。
- 解析后的结构数与原文件一致,空白页、OCR 和表格异常已列出。
- 头、中、尾真值问题全部通过,答案附页码或单元格。
- 所有数字已复算,单位、币种、期间和正负号无误。
- 引用已打开,原文直接支持对应结论。
- 下载文件已在 Word、Excel、PowerPoint 或 PDF 阅读器中打开并编辑。
- 模型、入口、账号、提示、日期、来源和人工修正已留档。
- 失败样本进入回归集,下一次更新会重新测试。
- 原文件未被覆盖,输出有版本、批准人和回滚路径。
常见问题
Kimi K3 能一次读完 100 万 token 的文档吗?
官方写的是最高上下文窗口,不是每个产品、会员和任务的统一保证。系统提示、历史、工具、图片、推理和输出都会占用窗口。是否“读完”要用头、中、尾真值问题和页码证据验证。
Kimi 生成的 Word、Excel 和 PPT 可以直接交付吗?
不能默认直接交付。必须在目标软件中检查样式、公式、母版、字体、数据、引用和可编辑性。高风险文档还需要专业人员批准。
扫描 PDF 为什么经常答错数字?
扫描件依赖 OCR,模糊、旋转、表格线、印章和相似字符都可能导致错误。关键金额、日期和编号应回到原图区域人工核对,必要时双人录入。
Kimi API 上传文件是否免费?
上传和抽取接口的当前计费规则要看官方页面;文件内容进入模型上下文后会计入输入 token。存储、抽取、推理和工具是不同阶段,不能用“上传免费”推断整个文件问答免费。
公司合同可以直接上传吗?
先依据公司政策、合同、数据分类和当前产品条款判断。脱敏不是万能许可;无法确认时不要上传,改用组织批准的企业、API 或私有环境。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 24 日重写。旧稿把 Kimi 描述成上传后即可准确理解百页文件的通用助手,没有说明解析失败、OCR、表格公式、页码证据、产品差异和隐私边界;本次新增六步证据工作流、五类文件验收、网页与 API 路线、真值集、数字复算、可编辑文件检查、失败回归和三张原创图。本站的来源、更新与纠错原则见关于本站与编辑规范。
