直接答案:AI 可以在明确的预期用途内辅助医疗筛查、病灶检测、病例分诊、定量测量和风险预测;少数产品在特定场景获准给出自主筛查结果。但“获得监管授权”“某个测试集准确率高”或“论文中优于医生”都不等于 AI 可以对所有患者独立诊断,更不等于可以直接决定治疗。可靠应用必须同时满足适用人群、设备、数据质量、临床流程、人工责任、外部验证、隐私安全和持续监测要求。

医疗提示:本文用于解释技术、监管与证据评估,不提供个人诊断、治疗或就医建议。出现症状、检查异常或用药问题,应咨询有资质的医疗专业人员。本文资料复核日期为 2026 年 7 月 19 日;产品状态、适应证和指南可能更新,采购或临床使用前必须查询所在地监管数据库和最新版说明书。
先分清:筛查、检测、分诊、诊断和预测不是一回事
“AI 诊断”常被当作一个宽泛营销词,但不同任务的错误后果完全不同。筛查用于从无症状或高风险人群中找出需要进一步检查者;检测用于在影像或信号中标出可疑区域;分诊用于调整病例优先级;诊断要结合病史、体征、检查与鉴别诊断;风险预测估计未来事件概率。文章、采购文件和产品说明若不写清任务,任何准确率都无法解释。
| 任务 | 典型输出 | 后续动作 | 不能自动推导 |
|---|---|---|---|
| 筛查 | 阴性、需转诊或复查 | 确证检查 | 最终疾病诊断 |
| 检测/标记 | 疑似病灶框、热图、尺寸 | 医生复核和测量 | 病变良恶性或治疗方案 |
| 分诊 | 优先级或紧急提醒 | 调整工作列表 | 确诊、出院或拒绝就诊 |
| 辅助诊断 | 候选判断、概率或第二读者意见 | 临床人员综合判断 | 替代完整临床上下文 |
| 自主筛查 | 在限定适应证内给出筛查结果 | 按说明书转诊或随访 | 扩展到其他疾病、人群和设备 |
| 风险预测 | 未来事件概率 | 评估、监测或干预讨论 | 必然发生或个体因果关系 |
医学影像 AI 的底层通常属于分类、检测、分割和测量任务,可先阅读计算机视觉任务、模型与评测指南。数据标注中的病灶边界、病理分级和专家分歧也必须记录,不应把单个标注者意见当作无争议真值。
什么证据才能支持“可用于临床”
WHO 的 AI for health 监管考虑要求明确预期用途、外部验证、数据质量、人类干预、网络安全和全生命周期合规。IMDRF 2025 Good Machine Learning Practice进一步把多学科团队、代表性数据、独立测试、人机交互和部署后监测作为医疗器械开发原则。一个模型应沿证据阶梯逐级前进,不能用低层证据替代高层结论。
| 证据层级 | 回答的问题 | 仍未证明 |
|---|---|---|
| 内部测试 | 模型能否复现开发数据模式 | 换医院、设备和人群是否有效 |
| 外部验证 | 在独立机构/时间段是否泛化 | 进入工作流后是否改善决策 |
| 读者研究 | 医生有无 AI 时性能如何变化 | 真实连续病例和操作压力下效果 |
| 前瞻性影子运行 | 实时数据、失败率和延迟是否可控 | AI 输出改变临床行为后的净效益 |
| 前瞻性比较/随机试验 | 流程、检测率、错误和资源是否改善 | 长期患者结局、成本和公平性 |
| 患者结局与上市后监测 | 真实世界获益、伤害和漂移 | 其他适应证或未来版本自动成立 |
DECIDE-AI用于早期、小规模、真实临床环境下的 AI 决策支持评估,关注安全、临床效用和人因;TRIPOD+AI规范预测模型研究报告;进入随机试验时,CONSORT-AI要求说明输入输出处理、人机交互和错误案例。它们是报告规范,不等同监管批准或研究质量保证,但能帮助识别证据缺口。
五个可核验的医疗 AI 案例及其边界
案例一:糖尿病视网膜病变自主筛查——自主不等于通用诊断
FDA 的 IDx-DR De Novo 决定摘要记录了一个在规定相机、图像质量和适用人群条件下分析眼底图像、给出糖尿病视网膜病变筛查结果的自主 AI 设备。它证明“无需眼科医生先读图”在特定筛查路径中可以被监管评估,但边界仍由说明书限定:图像不可评估时需要重新采集或转诊,结果也不能扩展为其他眼病诊断。
| 已证明 | 未证明 | 医院要检查 |
|---|---|---|
| 限定场景的自主筛查流程可被监管审查 | 对所有相机、族群和眼病通用 | 适用人群、排除标准、设备与操作培训 |
| 设备包含图像质量判断与转诊输出 | 一次阴性永远排除疾病 | 不可评估率、转诊完成率和随访丢失 |
案例二:WHO 结核胸片 CAD——用于筛查和分诊,不是确证诊断
WHO 2025 年政策更新列出经独立评估的胸片 CAD 软件,用于肺结核筛查。WHO 的问答资料明确,CAD 判断胸片异常是否可能由肺结核造成,适用于筛查和分诊;确证仍需要 WHO 推荐的分子快速检测、培养或其他临床流程,而且儿童及不同人群有具体限制。
| 流程节点 | AI 作用 | 人类/实验室责任 |
|---|---|---|
| 人群筛查 | 对数字胸片评分或建议进一步检查 | 确定筛查对象、阈值和知情流程 |
| 分诊 | 帮助有限读片资源安排优先级 | 结合症状、流行病学和资源 |
| 确证 | 不能替代病原学确证 | 采集标本并完成推荐检测 |
| 治疗 | 不能单独决定方案 | 医生依据确诊、耐药和指南治疗 |
案例三:乳腺筛查 MASAI——从读片性能走向真实筛查流程
MASAI 随机试验注册比较 AI 支持的乳腺筛查读片与标准双读流程。它的重要性不只在某个准确率,而在于前瞻性随机设计、连续筛查人群、召回、癌症检出、读片工作量和间期癌等临床流程指标。即使结果有利,也不能直接复制到不同国家、筛查年龄、设备、读片制度或患病率环境。
| 应读指标 | 为什么重要 | 常见误读 |
|---|---|---|
| 癌症检出率 | AI 是否找到更多临床相关病例 | 只看增加,不看过度诊断 |
| 召回/假阳性 | 额外检查、焦虑和成本 | 把更多召回等同更安全 |
| 间期癌 | 反映筛查后较快出现的漏诊或快速进展病例 | 忽略足够随访时间 |
| 工作量 | 决定系统能否缓解而非转移负担 | 只算读片时间,不算复核和故障 |
| 亚组 | 年龄、乳腺密度等可能影响表现 | 用总体平均掩盖弱势亚组 |
案例四:Paige Prostate——数字病理辅助,而不是跳过病理医师
FDA De Novo 数据库把 Paige Prostate 分类为辅助数字病理用户的软件算法设备。决定摘要说明,病理医师先完整查看前列腺穿刺活检数字切片并作出癌、非癌或延后判断,再激活软件查看输出。这种顺序用来降低锚定和自动化偏差;它不是让模型独立签发病理报告。
| 环节 | 安全设计 | 医院验收 |
|---|---|---|
| 切片与扫描 | 限定扫描设备和图像质量 | 染色、扫描、焦点和文件完整性 |
| 初读 | 病理医师先独立查看 | 记录调用前判断和用时 |
| AI 辅助 | 提示可疑区域供复核 | 命中、漏标、误标和难例 |
| 报告 | 最终责任仍由病理流程承担 | 签发权限、审计日志和争议处理 |
案例五:医院风险预测——内部高分可能在外院失效
电子病历风险模型容易受到编码、检验频率、就诊流程和人群变化影响。一项对广泛部署的专有脓毒症预测模型进行外部验证的研究显示,真实医院中的表现和告警负担可能与开发或宣传预期不同。这个案例的价值不是否定所有风险模型,而是说明医院必须用本地连续数据验证校准、有效提前量和告警量,并让模型与明确的响应路径配套。
| 风险模型问题 | 必须报告 | 上线门槛 |
|---|---|---|
| 预测时间点 | 何时开始使用哪些数据 | 没有使用事件发生后的信息 |
| 标签定义 | 疾病/事件标准与标注时间 | 临床认可且可重复 |
| 校准 | 预测 10% 的人实际发生比例 | 本院和关键亚组均可接受 |
| 告警负担 | 每班、每百床和每位医生告警量 | 不会导致普遍忽略 |
| 有效提前量 | 距离可行动时间还有多久 | 足以改变处理而非事后提示 |
监管授权到底证明了什么
FDA AI-enabled medical device list是已识别并获美国上市授权产品的透明资源,但 FDA 明确说明该清单并不完整;授权依据具体提交、预期用途和技术特征,不能转化为对整个公司、算法家族或未来版本的背书。中国方面,国家药监局 2025 年公开答复说明已发布人工智能医疗器械注册审查指导原则等系列文件;北京药监局医用软件审评问答列出人工智能医用软件、深度学习辅助决策、辅助检测和病理图像 AI 的审评关注点。
| 看到的表述 | 正确理解 | 还要查什么 |
|---|---|---|
| “FDA cleared/authorized” | 特定产品通过相应上市前路径 | 提交号、预期用途、禁忌、设备和版本 |
| “NMPA 注册” | 具体注册证范围内可上市使用 | 注册证、管理类别、结构组成和适用范围 |
| “临床试验中” | 正在生成证据 | 注册、方案、主要终点和结果是否发布 |
| “论文发表” | 研究经过期刊流程 | 设计、外部验证、偏倚和临床适用性 |
| “准确率 95%” | 单一数据集上的某个统计量 | 敏感度、特异度、患病率、置信区间和亚组 |
FDA 2025 AI 医疗器械生命周期文件目前标为草案、非实施性建议,引用时必须保留“Draft”状态;而预定变更控制计划 PCCP 文件已于 2025 年成为最终指南。两者都强调模型更新不是普通网页升级:修改范围、验证方法和影响评估要在质量与监管框架内管理。
为什么“准确率”经常误导医疗决策
假设某疾病在人群中患病率为 1%,模型敏感度与特异度都很高,阳性结果中仍可能有大量假阳性。PPV、NPV 会随患病率变化;AUC 不告诉你某个实际阈值的告警量;F1 也不能代替漏诊和误诊的临床代价。必须先定义使用场景,再选阈值和指标。
| 指标 | 回答什么 | 不能单独回答 |
|---|---|---|
| 敏感度 | 真实患病者中检出的比例 | 阳性结果有多少是真的 |
| 特异度 | 真实无病者中排除的比例 | 漏诊有多少 |
| PPV | 阳性结果中真实患病比例 | 换患病率后是否保持 |
| NPV | 阴性结果中真实无病比例 | 是否适合排除高风险病例 |
| AUROC/PR-AUC | 跨阈值区分能力 | 选定阈值的真实工作量 |
| 校准 | 预测概率是否对应实际风险 | 使用该概率是否改善结局 |
| 决策曲线/净获益 | 阈值下的潜在临床价值 | 真实流程中的人因与成本 |
把指标换算成每 1 万人会发生什么
评审时不要停在百分比。可以把候选阈值换算成一个固定规模的人群,让临床、信息、管理和患者代表看到同一张账。下面是教学用假设,不代表任何具体产品:若在 1 万名筛查对象中,目标疾病患病率为 2%,模型敏感度为 90%、特异度为 95%,则预计有 200 名患病者和 9800 名无病者。模型会找出约 180 名真阳性,同时漏掉约 20 名患者;在无病者中约有 490 名假阳性。因此模型一共发出约 670 个阳性提醒,其中真实患病者约占 27%。这不是说模型差,而是说明低患病率筛查天然会产生较多复查工作,阳性结果不能直接等同确诊。
| 换算项 | 教学假设结果 | 上线前要问 |
|---|---|---|
| 真阳性 | 约 180 人 | 这些人能否及时获得确证检查和治疗? |
| 假阴性 | 约 20 人 | 漏掉的是哪些亚组,是否有安全网和复筛? |
| 真阴性 | 约 9310 人 | 阴性后是否仍需按症状或风险进入其他路径? |
| 假阳性 | 约 490 人 | 复查容量、焦虑、费用和侵入性风险能否承受? |
| 阳性预测值 | 约 27% | 目标医院患病率变化后是否重新校准? |
同一个模型换到专科门诊、基层筛查和急诊,患病率、病例难度与处置资源都会变化,PPV、NPV 和净获益也会跟着变。医院因此要预先写明最低敏感度、可接受假阳性量、不可评估率、处理时限和关键亚组门槛,并给出置信区间;样本太少时,即使点估计达标也不能证明稳定。阈值选择还必须与下游能力联动:每天多产生 100 个提醒,但只能完成 20 个确证检查,可能延长真正患者的等待时间。反过来,过度提高阈值虽然减少告警,却可能把漏诊转嫁给患者。
还要分开“模型误差”和“系统误差”。模型在输入正确时预测错误,是模型误差;错人错片、单位转换、接口字段错位、旧版本缓存、网络超时后重复提交、结果未进入医生工作列表,则属于系统与流程误差。离线论文通常只覆盖前者,医院验收必须覆盖两者。最实用的报告不是一个总准确率,而是混淆矩阵、不可评估数量、失败原因、亚组表现、校准曲线、处理延迟、医生采纳与推翻情况,以及每个错误最后是否影响临床行动。
临床工作流:AI 输出必须有明确的接收者和失败路径

| 工作流节点 | 系统必须显示 | 失败时动作 |
|---|---|---|
| 患者/检查匹配 | 身份、检查时间、设备和适用条件 | 阻止错人错片 |
| 输入质控 | 完整性、图像质量、缺失值和异常 | 拒答、重采或转人工 |
| 模型输出 | 结果、置信度、阈值、版本和时间 | 超时或离线走既有流程 |
| 临床复核 | 原始资料、AI 提示和关键上下文 | 允许不同意并记录原因 |
| 诊疗决定 | 最终责任人和依据 | 高风险需升级/会诊 |
| 反馈监测 | 确证结果、后续事件和错误分类 | 触发调查、停用或回滚 |
上线前可采用AI 产品可用性测试与失败恢复方法模拟夜班、网络抖动、错误患者、重复检查和高峰积压。测试对象不只是医生,还包括技师、护士、信息科、医工、质控和应急人员。
数据与标签:真实世界不是一个干净 CSV
医疗数据的泄漏风险尤其高。同一患者的多次检查不能随机落入训练与测试两侧;病理切片的小图块必须按患者隔离;用“医生是否开药”作为疾病标签可能学到医生习惯而非疾病;用检查完成后的变量预测检查前风险会制造时间穿越。外包数据处理或标注时,应建立数据最小化、去标识、访问控制、专家资格、金标仲裁和删除证明,可参考AI 数据供应商采购与验收及标注平台质量控制指南。
| 数据风险 | 错误做法 | 验收方法 |
|---|---|---|
| 患者泄漏 | 同一患者影像随机切分 | 按患者、机构和时间隔离 |
| 时间泄漏 | 使用预测时点之后的信息 | 逐字段建立可用时间表 |
| 标签偏差 | 单个医生判断当绝对真值 | 确证标准、双读/仲裁和不确定标签 |
| 设备偏差 | 只用一个品牌或协议 | 按设备、参数和图像质量分组 |
| 人群不足 | 关键年龄/性别/共病样本稀少 | 亚组样本量、指标和置信区间 |
| 隐私越界 | 为未来用途无限保留数据 | 目的、权限、期限、审计和删除记录 |
人机协作也要做随机或受控评测
医生加 AI 不一定等于两者优势相加。AI 可以帮助发现遗漏,也可能产生锚定、过度信任、确认偏差或额外点击。读者研究需随机化病例顺序,控制学习与记忆效应,明确医生先读还是 AI 先提示,并报告医生不同意 AI 的情况。真实上线还要关注报警疲劳、科室间差异和工作量转移。
| 比较组 | 应测结果 | 隐藏风险 |
|---|---|---|
| 医生单独 | 基线性能、时间和分歧 | 基线样本不代表真实难度 |
| AI 单独 | 模型性能、失败率和拒答 | 缺少临床上下文 |
| 医生 + AI | 最终判断、时间、改错与改错为错 | 自动化偏差与额外负担 |
| 真实流程 | 转诊、复查、等待、结局和不良事件 | 其他流程变化造成混杂 |
隐私、网络安全和生成式 AI 边界
健康信息通常属于敏感个人信息。医院应执行最小必要、明确目的、分级授权、传输与存储保护、供应商访问审计和事件响应;不能把真实病历直接粘贴到未经批准的公共聊天工具。若使用大语言模型生成病历摘要、鉴别诊断或患者沟通文本,必须把来源忠实度、遗漏、幻觉和提示注入作为独立风险,不能把“语言流畅”当临床正确。
| 控制域 | 最低要求 | 拒绝上线条件 |
|---|---|---|
| 身份与权限 | 最小权限、多因素、角色与紧急访问 | 供应商共享管理员账号 |
| 数据流 | 字段、去向、地域、保留期和删除可见 | 无法说明数据去了哪里 |
| 模型接口 | 输入校验、限流、超时和输出过滤 | 外部输入可影响其他患者结果 |
| 日志 | 患者、模型版本、输出、查看和最终决定 | 事故后无法追溯 |
| 第三方 | 分包商、训练使用、事件通报和退出 | 默认二次训练且不能退出 |
| 应急 | 停用开关、降级流程、演练和恢复目标 | 系统离线即阻断医疗 |
医疗 AI 的威胁建模、权限、测试、监控和事件处置可结合AI 安全全生命周期指南与AI 失效、攻击和系统性影响分析。
医院 90 天试点:先影子运行,再有限开放
| 阶段 | 工作 | 必须产出 | 继续条件 |
|---|---|---|---|
| 第 1–15 天 | 核对证照、预期用途、流程与风险 | 用途卡、责任矩阵、数据流图 | 与本院场景和设备匹配 |
| 第 16–30 天 | 冻结本地验收集和既有流程基线 | 统计方案、亚组、错误成本 | 无患者/时间泄漏 |
| 第 31–50 天 | 离线外部验证和故障测试 | 性能、校准、不可评估率和安全报告 | 达到预设门槛 |
| 第 51–70 天 | 前瞻性影子运行,不显示给临床 | 延迟、失败、漂移和病例复盘 | 系统稳定且错误可解释 |
| 第 71–85 天 | 小范围显示,保留人工批准 | 人机分歧、时间、告警和不良事件 | 净临床价值为正 |
| 第 86–90 天 | 治理委员会复盘 | 上线/整改/停止决定与回滚演练 | 责任、预算和监控长期可持续 |
若团队缺乏临床试点设计能力,可先按AI 咨询需求、PoC 与验收指南写清问题、范围和停止条件;内容、事实与发布材料则使用人工审核流程复核,避免把未发表内部结果包装为“真实案例”。
采购合同必须写进的条款
| 条款 | 供应商应提供 | 医院应保留 |
|---|---|---|
| 产品身份 | 注册/授权号、版本、模块和说明书 | 使用范围和配置基线 |
| 证据 | 研究方案、数据分布、指标、亚组和限制 | 本地独立验收权 |
| 更新 | 变更日志、影响评估、回归测试和通知期 | 拒绝升级与回滚权 |
| 数据 | 处理目的、位置、分包、期限和删除 | 审计、导出和终止权 |
| 服务 | SLA、容量、灾备、事件通报和修复 | 安全降级流程 |
| 责任 | 产品缺陷、网络安全和不合规责任 | 临床责任边界和保险安排 |
| 退出 | 数据、日志、配置和接口迁移 | 不被供应商锁定 |
合同中的性能承诺应绑定具体版本、设备、人群、输入质量和阈值,而不是写“准确率不低于 95%”这种无法执行的句子。建议把验收分为离线、本地影子运行和有限临床开放三关:供应商不得用自己的演示集替代医院冻结的验收集,也不得在看到测试结果后反复调阈值却不重新计算统计有效性。若产品依赖云端服务,还应明确数据出境与存储区域、网络中断时的安全降级、峰值容量、日志导出格式和供应商远程访问审批。
停用条件必须和上线条件同样具体。例如关键亚组敏感度低于门槛、不可评估率连续超限、出现错人错片、模型版本未经批准改变、严重安全事件、确证结果回流中断或临床人员无法访问原始资料,都应自动触发暂停、人工接管和事件复盘。恢复不能只看服务重新在线,还要确认积压病例、重复结果、数据完整性和受影响患者已经被逐一处置。这样医院购买的才是一套可治理的临床能力,而不是一个无法审计的算法接口。
医疗 AI 医院上线记分卡

| 门禁 | 通过证据 | 红线 |
|---|---|---|
| 预期用途 | 患者、疾病、输入、设备、用户和输出完全匹配 | 把研究原型或其他适应证直接临床使用 |
| 临床证据 | 外部验证、前瞻性流程和适当比较证据 | 只凭内部准确率或厂商演示 |
| 数据泛化 | 本院、设备、亚组、时间和难例均达门槛 | 关键人群不可接受且无缓解 |
| 人机流程 | 输入质控、拒答、人工复核、责任和降级明确 | 高风险决定无人负责 |
| 隐私安全 | 数据流、权限、日志、供应链和应急通过审查 | 患者数据去向不明或无法审计 |
| 持续监测 | 性能、校准、失败、漂移、不良事件和回滚常态化 | 上线后无人监控或供应商静默更新 |
患者和普通用户怎样判断一个“AI 诊断”说法
| 要问的问题 | 可信回答应包含 |
|---|---|
| 它究竟做什么? | 筛查、检测、分诊、辅助诊断或风险预测中的一个明确任务 |
| 适用于谁? | 年龄、症状、疾病、检查设备和排除条件 |
| 谁作最终决定? | 有资质医务人员或特定自主筛查路径及转诊安排 |
| 证据是什么? | 独立验证、前瞻性研究、监管数据库或指南链接 |
| 出错怎么办? | 不可评估、复查、转诊、申诉和不良事件报告流程 |
| 数据去哪了? | 收集目的、保存地点、第三方、保留期限和删除方式 |
常见问题
AI 医疗诊断比医生更准吗?
不能脱离具体任务、数据、人群和比较设计回答。AI 可能在某个检测任务和测试集上优于特定读者,也可能在新医院、稀有病例或低质量输入上失效。真正相关的是医生加 AI 后,真实流程、错误、工作量和患者结局是否改善。
获得 FDA 或 NMPA 授权就可以放心使用吗?
授权是必要证据之一,不是无限保证。医院仍需核对注册范围、版本、设备、适用人群、培训、网络环境和本地表现,并持续监测不良事件和模型漂移。超出预期用途使用需要独立的法律、伦理和临床判断。
通用大模型能直接看化验单或影像诊断吗?
消费者通用模型不应被默认当作医疗器械或临床诊断系统。它可能遗漏、误读、编造依据,也可能把敏感健康数据发送给未批准的第三方。个人应把检查报告交给有资质的医疗专业人员解释。
医院最应该先试点什么任务?
优先选择预期用途清晰、可撤销、已有确证结果、错误后果可控且能影子运行的任务,例如工作列表分诊或限定筛查辅助。不要从自动处方、自动出院或无法人工复核的高风险决定开始。
结论:医疗 AI 的单位不是“模型”,而是完整临床干预
一个医疗 AI 系统的真实效果由患者、检查设备、数据质量、模型、界面、使用者、阈值、临床路径和后续资源共同决定。IDx-DR、WHO 结核 CAD、MASAI、Paige Prostate 和脓毒症模型外部验证分别说明:自主可以存在但边界严格,筛查不等于确诊,随机试验比静态准确率更接近临床价值,辅助工具需要设计使用顺序,而广泛部署也不能替代本地验证。最可靠的上线策略是明确预期用途、逐级生成证据、保留人工责任、持续监控并随时能够停用。
