直接答案:百川智能是一家 2023 年成立的大模型公司,当前公开重点已经从早期通用模型扩展到医疗模型与健康助手。普通用户面对的是“百小医”,开发者和机构可查看医疗模型 API,研究者则会看到 Baichuan-M4、M3、M2、M1 等论文或模型资料;2023 年的 Baichuan 2 开源权重属于另一条历史产品线。它们不能混称为同一个产品,更不能因为论文或榜单分数较高,就直接推断可以替代医生、自动诊断或在医院无验证上线。

医疗提示:本文用于产品识别、证据解读和采购前核对,不提供个人诊断、处方或治疗建议。资料复核日期为 2026 年 7 月 19 日。模型版本、开放范围、价格、服务条款、隐私政策和监管状态会变化,使用前应重新查阅官方页面;出现呼吸困难、意识异常、持续胸痛、大出血等急症信号时,不应等待 AI 回复。
先纠正旧稿:公司宣传、融资新闻和临床证据不是一回事
本页旧稿标题把百川智能称为“医疗大模型领军者”,正文还写入融资金额、投资机构、估值、医院合作、客户数量、医疗准确率和商业前景,却没有给出能够逐项核验的公告、合同、研究方案、监管记录或独立数据。旧稿还把创始人的教育经历写成医疗技术护城河,把产品路线写成确定的投资价值。这些内容既不能帮助用户选择产品,也容易把公司叙事误当成临床证据,因此本次重写全部撤回。
| 旧稿说法 | 为什么不可靠 | 本次处理 |
|---|---|---|
| “医疗大模型领军者” | 没有定义范围、时间、指标和独立排名 | 改为可核验的公司与产品地图 |
| 融资、估值与投资机构清单 | 缺少当期官方披露,且与用户选型任务无直接关系 | 不再转述无法核验的资本数字 |
| 与多家医院合作并积累海量数据 | 没有医院名称、合同边界、伦理审批和数据来源 | 删除匿名合作与数据规模叙述 |
| 医疗准确率显著高于通用模型 | 没有任务、样本、分母、对照和外部验证 | 拆成具体基准、作者论文与临床证据层级 |
| 创始人背景构成医疗护城河 | 个人履历不能替代产品证据、团队能力和治理 | 只保留官方可核验的公司身份 |
| 具备确定的投资与商业价值 | 属于预测,不是产品使用指南 | 删除投资判断,聚焦用户决策 |
百川智能现在有哪些与医疗相关的入口
根据百川智能官网,公司于 2023 年 3 月 24 日成立,创始人为王小川。官网当前显著展示百小医、医疗模型和“海纳百川”计划,并保留通用大模型相关入口。对用户最重要的不是背下全部型号,而是确认自己正在使用哪一种交付形态。
| 入口或系列 | 面向对象 | 当前可确认的定位 | 不要误解为 |
|---|---|---|---|
| 百小医 | 个人与家庭用户 | 健康信息、就医准备、报告或医嘱理解等辅助服务 | 持证医生、急救系统或自动处方 |
| 医疗模型 API | 开发者、医疗服务机构 | 通过平台调用 M3 Plus、M3、M2 等服务;资格和功能以页面为准 | 拿到密钥即可在真实临床自动决策 |
| Baichuan-M4 | 研究与产品观察者 | 2026 年论文描述的连续照护医疗智能体系统 | 已经完成所有外部临床验证的监管产品 |
| Baichuan-M3 | 研究者、模型部署者 | 强调主动问诊、医疗推理和幻觉抑制的医疗增强模型 | 在所有疾病、医院和人群上都优于医生 |
| M2、M1 等 | 存量用户与研究者 | 较早医疗模型代际,部分仍出现在平台或资料中 | 与 M4 功能、接口和证据完全相同 |
| Baichuan 2 | 本地模型研究与旧项目 | 2023 年开放权重的通用模型系列 | 当前百小医或最新医疗 API 的同义词 |
产品名相近还会造成另一个误区:官网研究页出现 M4,不代表平台所有账号已经提供同名 API;价格页出现 M3 Plus,也不代表任何行业和用途都能直接申请。选型时应分别打开当前 API 文档、价格页和申请条件,并记录查看日期、模型标识、上下文限制、搜索计费、速率限制和数据条款。
M4、M3、M2 和 Baichuan 2 的关系
Baichuan-M4 论文发表于 2026 年 6 月,作者把它描述为面向连续照护的医疗智能体系统:除了核心推理模型,还包含患者记忆、循证检索、工具使用、多智能体协调,以及文档 OCR、X 光和皮肤影像等多模态能力。论文报告了多个内部或公共评测结果,并在其幻觉评估中给出 3.3% 的数值;但论文也明确说明,输出供医生和机构参考,不替代持证医生的最终诊断与治疗决策。
Baichuan-M3 论文发表于 2026 年 2 月,重点是主动补问、长程临床推理与安全控制。M2、M1 是更早代际,官网和平台资料应被视为具体版本的当期说明。Baichuan 2 官方 GitHub 仓库则是 2023 年通用模型项目;开源权重可以支持本地研究,但不自带当前医疗模型的训练、检索、工具、服务保障或合规安排。
| 比较维度 | M4 | M3 | M2 / M1 | Baichuan 2 |
|---|---|---|---|---|
| 主要公开时间 | 2026 年 | 2026 年 | 更早医疗代际 | 2023 年 |
| 公开重点 | 连续照护、记忆、工具与多模态智能体 | 主动问诊、推理与幻觉控制 | 医疗问答、推理或循证增强的阶段版本 | 通用语言模型与开放权重 |
| 常见交付 | 论文和产品路线说明;实际开放以官网为准 | 论文、模型资料及部分平台服务 | 平台存量模型或资料 | 下载权重,自行部署 |
| 证据边界 | 作者团队评测不等于跨机构临床效果 | 基准领先不等于真实工作流安全 | 旧结果不能自动代表新版本 | 通用权重不等于医疗器械或医疗服务 |
“HealthBench 第一”和“3.3% 幻觉率”应该怎样读
HealthBench 官方说明显示,这项基准包含 5,000 段模拟的多轮、多语言健康对话,以医生编写的细粒度规则评价模型最后一轮回答。它比只考医学选择题更接近健康问答,但仍是基准评测:样本由合成生成和人工对抗测试构成,评分主要由模型判定是否满足规则,不是在医院中观察真实患者结局。
因此,M4 或 M3 在 HealthBench、HealthBench Hard 或团队自建 ScanBench 上取得较高分,能够支持“在这些测试定义下表现较好”,不能直接支持“诊断准确率达到某值”“所有临床任务优于医生”或“可无人监管使用”。论文中的 3.3% 也必须与作者定义的幻觉数据集、评判器、提示、模型版本和统计方法绑定,不能作为所有回答有 96.7% 临床正确率的倒数。

| 证据 | 能支持什么 | 仍不能支持什么 | 下一步核验 |
|---|---|---|---|
| 官网产品页 | 公司当前公开的定位、入口和申请说明 | 独立效果、长期安全和临床获益 | 查服务条款、版本和可用性 |
| 作者预印本 | 方法、训练框架、团队评测和限制 | 同行评议结论、跨机构复现和监管许可 | 找代码、数据、外部复现和审稿版本 |
| HealthBench 等公共基准 | 固定样本与评分规则下的相对表现 | 真实患病率、流程、设备和患者结果 | 检查版本、提示、评分器和置信区间 |
| 医院回顾性验证 | 历史本地数据上的错误和亚组差异 | 上线后人机互动和行为改变 | 静默运行与前瞻试点 |
| 前瞻临床研究 | 真实使用中的工作流、安全与结果 | 超出研究人群、科室和版本的泛化 | 持续监测、版本复验与监管核对 |
医疗 AI 的公开报告可参考DECIDE-AI 早期临床评价指南:除了算法性能,还应说明使用者、环境、人机互动、工作流、错误和安全事件。若准备把任何大模型接入医院,请配合本站的医院 AI 从静默验证到上线监测清单和AI 医疗诊断临床验证指南使用。
个人用户:百小医适合做什么,不适合做什么
百小医的公开定位更接近健康信息与就医辅助。它可以帮助用户整理症状时间线、解释常见医学词汇、准备就诊问题、理解检查报告字段或提醒复诊事项。根据百川智能的用户协议,医疗相关输出仅供参考,不构成专业医疗服务、诊断、处方或治疗依据。这条边界比任何营销语更重要。
| 任务 | 可以怎样用 | 必须人工确认 | 不应交给 AI |
|---|---|---|---|
| 就医准备 | 整理起病时间、症状变化、既往史和问题清单 | 信息是否完整,急症是否需立即处理 | 决定不去医院 |
| 报告理解 | 解释指标名称、单位和常见含义 | 参考范围、标本、影像原文和医生判断 | 只凭一个异常值自行诊断 |
| 医嘱理解 | 把专业表述改写为待确认的问题 | 药名、剂量、频次、疗程和禁忌 | 擅自停药、换药或加量 |
| 慢病记录 | 整理血压、血糖、症状和复诊时间线 | 设备准确性、异常阈值与治疗目标 | 自动调整处方 |
| 急症判断 | 只能提示尽快寻求帮助 | 由急救、医生或当地医疗系统处置 | 反复聊天等待确定诊断 |
输入健康信息前应查看当期百小医隐私政策和账号设置,确认处理主体、收集字段、第三方共享、保存、删除和账号注销方式。尽量不输入身份证号、完整病历号、联系方式、可识别人脸、他人报告或与问题无关的病史;需要医生判断时,保留原始报告和完整上下文,不要只转述 AI 的摘要。
开发者:接入医疗 API 前先做五项确认
官网“海纳百川”计划对申请主体和用途有约束,公开页面强调面向服务医疗专业人士的机构、临床决策支持或医学教育等场景,并要求真实服务使用、展示来源标识等。具体条件可能调整,应以申请页面和合同为准。免费或优惠也不等于无限调用、永久价格或免除安全责任。
| 检查项 | 必须记录 | 阻断条件 |
|---|---|---|
| 模型与接口 | 模型 ID、版本、上下文、搜索、工具、限流和错误码 | 只写“百川医疗模型”,无法固定版本 |
| 数据 | 输入字段、地区、保存、训练使用、第三方、日志和删除 | 真实患者数据流向不清 |
| 输出 | 引用、拒答、结构化字段、置信提示与禁止动作 | 输出可直接写入处方或诊断而无复核 |
| 评测 | 本地病例、严重错误、亚组、提示注入和版本回归 | 只用演示问题或厂商榜单验收 |
| 运行 | 超时、重试、降级、人工升级、审计与停用 | 接口失败会阻断医疗服务 |
| 成本 | 输入输出 token、搜索、知识库、缓存、峰值和重试成本 | 只看单价,不模拟真实请求链 |
百川平台的安全与风险说明也要求开发者针对预期用途验证可靠性、准确性和稳健性,并进行监测与人工干预。开发阶段先使用合成数据或经过授权和去标识化的数据;任何真实病历接入都应经过组织的数据、法律、安全、伦理和临床责任流程。通用的函数调用权限控制可参考AI 安全威胁建模指南,涉及基层或县域协同时可参考基层医疗 AI 落地清单。
医院采购:不要购买“模型名”,要验收一个明确用途
医院不能把“使用 Baichuan-M4”作为完整项目定义。应写清谁在什么科室、对什么患者、读取哪些数据、生成什么输出、谁在多长时间内复核、错误如何升级、系统不可用时回到什么流程。世界卫生组织的医疗 AI 伦理与治理指南和大模型医疗治理指南都强调预期用途、利益相关方参与、透明、责任和发布后审计。

| 采购问题 | 合格证据 | 不能接受的替代说法 |
|---|---|---|
| 产品到底是什么 | 合同型号、版本、组件、部署边界和变更通知 | “使用最新医疗大模型” |
| 允许做什么 | 预期用途、禁用人群、禁止动作和责任人 | “辅助医生全面提效” |
| 证明了什么 | 对应任务的外部证据、本地数据和错误明细 | 只展示综合榜单或发布会数字 |
| 如何保护数据 | 数据流、权限、日志、第三方、跨境、保留和删除 | “私有化所以绝对安全” |
| 如何持续监测 | 严重错误、亚组、漂移、延迟、事件与人工修改看板 | 只统计调用量和医生采纳率 |
| 如何退出 | 数据导出、模型停用、接口替代、删除证明和原流程恢复 | 合同到期再讨论 |
国家卫生健康委等部门的“人工智能+医疗卫生”实施意见给出了可探索场景,但政策鼓励不等于某个模型已经获得特定临床用途的批准。具体产品是否涉及医疗器械、互联网诊疗、病历、个人信息或数据安全要求,应按实际功能和数据流逐项判断。
隐私与条款:上传前要看“数据之后去哪”
健康与病历数据通常比普通聊天内容风险更高。个人信息保护法将医疗健康信息列为敏感个人信息,处理需要特定目的、充分必要性和严格保护。百川智能官网与平台分别提供用户协议和隐私政策;消费者产品、开发者平台与定制项目的条款可能不同,不能用一份页面替代合同审查。
| 对象 | 上传前问题 | 建议 |
|---|---|---|
| 个人 | 是否必须输入身份、报告原图或完整病史 | 最小化输入,遮盖无关识别信息 |
| 开发测试 | 样本是否含真实患者或可重新识别字段 | 优先合成数据;建立授权、去标识和访问记录 |
| 生产 API | 内容是否保存、用于改进、由谁处理、能否删除 | 写入数据处理协议和技术配置,不靠口头承诺 |
| 医院部署 | 模型、检索、日志、监控和支持人员分别访问什么 | 画完整数据流,做最小权限和供应商审计 |
| 终止服务 | 数据、向量库、日志、备份和派生内容如何处理 | 合同中写明导出、删除时限与证明 |
如果系统会长期保存患者记忆,除了确认功能有用,还要明确记忆的来源、纠错、过期、合并、删除与访问权限。模型“记得更多”不一定更安全:错误病史、错配患者或过期用药同样可能被持续放大。
三个常见选择场景
只想理解自己的报告或准备就医
优先使用面向个人的产品入口,把任务限制为信息整理和问题准备;保留报告原文,不让 AI 决定诊断或用药。任何与医生意见冲突的内容,回到医生或药师确认。本站的AI 幻觉核验方法可用于拆分回答中的事实与推断。
要给健康应用增加问答功能
先确认 API 资格和用途,再做带严重度分级的本地评测。评测至少包含信息不足、急症、孕产妇、儿童、老年、多病共存、药物冲突、提示注入、无依据引用和接口失败。上线前建立人工升级和停用开关,不要把模型自由文本直接写入诊疗记录。
医院准备采购或试点
先选一个边界清楚且能人工复核的任务,例如病历缺项提示或出院随访问题整理;完成历史数据验证、静默运行和有限真实试点,再决定扩大范围。不要把发布会分数写成验收指标,也不要承诺固定的“效率提升百分比”。采购、试点和监测步骤详见医院 AI 落地完整清单。
怎样自己复核一条百川模型宣传
看到“第一”“超过某模型”“幻觉率最低”或“临床级”时,不必立刻接受或否定,可以把句子拆成可验证字段。先找最初出处,再找论文中的表格、脚注和限制;如果只有媒体转载,要继续追到公司页面、论文或数据仓库。日期同样重要:模型、对手、提示和评判器只要有一个变化,旧排名就可能失效。
| 字段 | 需要回答的问题 | 缺失后的正确写法 |
|---|---|---|
| 对象 | 具体是 M4、M3、M3 Plus,还是带检索和工具的完整系统? | 不能笼统写“百川模型” |
| 任务 | 健康问答、主动问诊、报告 OCR、影像理解还是诊断决策? | 只能说“在该测试任务中” |
| 数据 | 公共还是团队自建,是否可能进入训练,包含哪些语言和人群? | 不能外推到所有疾病和患者 |
| 对照 | 比较模型的精确版本、日期、提示、工具和推理预算是否一致? | 不能只写“超过 GPT” |
| 评分 | 人工医生、模型评分器还是规则;有没有一致性和置信区间? | 应标注评分方法和不确定性 |
| 复现 | 是否公开代码、样本、提示、日志或独立复测? | 标注为作者团队报告 |
| 用途 | 测试结论与实际产品的预期用途、输入和人工门禁是否一致? | 不得直接写成临床可用证明 |
例如,“M4 幻觉率 3.3%”至少要展开为:Baichuan-M4 作者团队在论文所述评测设置、数据和判定规则下报告 3.3%;该数值不等于诊断错误率,也没有自动覆盖百小医每次对话、所有 API 配置或医院真实病例。这样写会少一点戏剧性,却能让读者知道结论从哪里来、适用于哪里、还缺什么。
本地评测不要只复制公共榜单
公共基准适合做起点,本地评测则要围绕真实任务的失败后果设计。开发者和医院应先冻结模型、系统提示、检索源、工具权限和输出结构,然后用历史样本与合成边界样本测试;测试集要包含正常案例,也要包含信息缺失、相互矛盾、罕见情况、急症、否定表达、单位错误、患者错配和恶意指令。每个严重错误都需要保存输入、输出、引用、模型版本、人工结论和处置,而不是只汇总一个平均分。
| 测试层 | 示例 | 至少记录 |
|---|---|---|
| 事实忠实 | 能否忠实读取报告、病史和指南,不补造缺失值 | 原文位置、错误类型、严重度 |
| 信息获取 | 关键信息不足时是否补问或拒答 | 缺失字段、补问质量、过早结论 |
| 安全升级 | 急症、禁忌和高风险人群能否转人工 | 升级时机、遗漏、误报和延迟 |
| 证据检索 | 引用是否真实、当前并支持对应主张 | 来源、版本、段落和检索失败 |
| 工具权限 | 是否会越权查询、写入、发送或执行 | 调用参数、批准人、结果和回滚 |
| 亚组 | 不同年龄、语言、疾病和机构是否出现差异 | 分层样本、置信区间和不可用范围 |
| 版本回归 | 模型或知识库更新后旧能力是否退化 | 前后版本、变化项和放行决定 |
如果样本量不足以证明某项高风险用途安全,正确结论不是降低门槛,而是把输出限制为信息整理、增加人工复核、缩小适用人群或暂不部署。真实运行后还要把人工修改、患者路径和安全事件加入监测,因为模型离线得分无法覆盖界面、提醒疲劳、人员培训和流程拥堵。
常见问题
Baichuan-M4 已经开放 API 了吗?
不能只凭 M4 论文或官网宣传推断所有开发者都能调用同名 API。本文复核时,平台价格与文档公开列出了若干 M3、M2 系列服务;M4 的具体开放对象、模型 ID、功能和价格应以账号控制台、最新文档或合同为准。
百小医可以替代医生吗?
不可以。官方用户协议把医疗输出限定为参考,不构成诊断、处方或治疗依据。它更适合帮助整理信息、理解术语和准备就医问题,急症、诊断和用药变更应由医疗专业人员处理。
HealthBench 分数高,能说明医疗水平更好吗?
它说明模型在 HealthBench 的样本与评分规则下表现较好。它不能单独证明在某医院、某疾病、某患者亚组或真实工作流中更安全有效,也不能替代监管核对、本地验证和持续监测。
3.3% 幻觉率是不是等于 96.7% 诊断准确率?
不是。幻觉率取决于测试集、定义、判定器、提示和模型版本,与诊断准确率、敏感度、特异度或患者结局不是同一个指标。引用该数字时必须保留论文方法和作者自评边界。
Baichuan 2 开源模型能否本地搭成医疗系统?
可以用于研究或原型,但开放权重不自动带来医疗训练数据、循证检索、患者记忆治理、临床验证、监管资格或运维保障。若用于真实医疗,应从预期用途、数据、评测、人机流程和责任重新建立完整证据链。
免费医疗 API 是否值得优先采用?
价格只是一个维度。还要比较用途限制、版本稳定性、搜索与知识库费用、数据条款、错误类型、人工负担、监测、迁移和退出成本。免费不能抵消患者安全、隐私和供应商锁定风险。
一页核对清单
| 门禁 | 通过标准 |
|---|---|
| 产品身份 | 入口、模型 ID、版本、交付方式与更新日期明确 |
| 用途 | 用户、人群、输入、输出、人工动作与禁用范围明确 |
| 证据 | 公司声明、作者论文、公共基准、外部验证和本地验证分层记录 |
| 数据 | 收集、传输、保存、训练、第三方、导出与删除可解释 |
| 安全 | 急症升级、拒答、权限、审计、错误处理和原流程降级可用 |
| 版本 | 更新通知、回归集、灰度、回滚和旧版本处置写入流程 |
| 运行 | 严重错误、亚组、延迟、成本、人工修改和安全事件持续监测 |
| 退出 | 能停用、迁移、导出、删除并恢复替代流程 |
延伸阅读:医院项目请看医院 AI 场景选择与上线门禁;基层机构请看县域医共体与基层医疗 AI 清单;诊断类产品请看临床验证与错误分层;通用风险请看AI 威胁模型与权限控制;本站来源、更新与纠错原则见关于兰塞 AI 与编辑规范。
编辑复核与纠错记录:本文由兰塞 AI 编辑流程于 2026 年 7 月 19 日重写。旧稿中无法核验的融资、估值、投资机构、医院合作、客户规模、准确率、创始人护城河和投资价值叙述已撤回;新版依据百川智能官网、平台文档、用户与安全条款、M4/M3 作者论文、HealthBench 官方资料、WHO 治理指南和临床实施报告规范,改为产品地图、证据阶梯、个人使用、API 接入与医院采购核对指南。后续若产品开放范围、条款或论文版本变化,本站将按可核验来源更新并保留纠错说明。
